无法解释的失败的正常化
在最近一集《库尔蒂斯总统》中,总统在两个不同的场合努力打开一扇门。这些门之所以打不开是因为有障碍物挡住了:一开始是一个尸体,然后是大约十亿美元的黄金。在这两个场景中,面对沮丧,角色喃喃自语“愚蠢的东西真糟糕”。这根本不是一个合理的门的模型!门不应无缘无故地“糟糕”!我觉得这些时刻太搞笑了¹,或许是我愚蠢的大脑真的很糟糕。Jev:制造更多糟糕的门 互联网一直在讨论Jev,这是一个由TypeSafe AI开发的AI模型,它返回带有概率估计的类型化值。就我所知,关于Jev的重要信息是:它快速、便宜,你可以快速构建,它快速,而且便宜。我并不特别擅长理解什么技术会被采纳。我仍然不理解² Slack。等一下。你还需要做艰难的部分吗?也许我的问题是在期待产品能正常工作。购买这些产品的人都没有进行评估。他们只是在给Jev提出不透明的问题并获取不透明的回应。大方地说,这让他们可以在星期五之前勾选“基于AI”框并发货,当这破坏了下游逻辑时,他们总能耸耸肩说“好吧,AI会犯错。”错误预算?失败模式?测试集?所有这些可以稍后处理。用户可以自行发现失败率!你已经发货了!虚假的自信 “哦,”反驳我帖子的人说道,“你没有考虑到Jev给你信心评分的事实!”你打算拿这些做什么?要你对信心评分做出合理的反应,你需要同时理解这些信心评分的校准情况以及关于不确定性成本的模型。在校准方面:Jev的顶层广告文案大多关注他们在各种基准上的得分,但不关注他们的信心评分的校准程度。关于使用信心评分上升分类树的做法确实有一本食谱,但这根本不是关于信心评分有多好的。在最好的情况下,人们以一种“崇拜”的方式使用信心评分。在最坏的情况下,人们把它们当作API调用失败的借口。模型仅有73%的信心!这意味着我的错误预算是27%! 责任感 当网站上的一个按钮失灵时,我有一个模型来理解应该发生什么。某个地方的合同被打破了。我的DNS坏了。某人发了一段含有JavaScript语法错误的杂乱代码,只在特定路径上执行。一个处理程序抛出一个预计不会抛出的异常。我可能无法通过仅仅HTTP状态500获得调试访问,但我希望有人会负责理解为何该端点会返回500。所有权是明确的,尽管不透明³。然而,对许多用户而言,实际体验大致就是“愚蠢的东西真糟糕。”软件已经令人感到任性;更多的失败只会增加挫折感。消去追踪失败到具体原因的可能性似乎并不是什么损失。有时候事情就是糟糕。这导致了无法解释性的正常化。我的担忧不是在LLM驱动开发加速时,更多的事情会失败。它们会。已经失败了。这是以新的方式构建事物的代价之一。我的担忧是“有时候就是糟糕”将越来越成为调查的被接受的结局。这令人难过,因为LLM加速开发确实可以帮助我们解决一些问题。有很多自动化QA工作流程未被编写,因为缺乏工程时间。最能让你替代(或甚至只为使用)Jev的评估距离成立仅有几个提示。今天软件工程的悲剧是,我们正在积极构建系统,用户和构建者似乎都对检查门后是否有一个尸体没有任何兴趣。我们只是耸耸肩得出结论:愚蠢的东西真糟糕。¹ 这让我想起一句我觉得同样搞笑的话:“有时你坐电梯,有时你被抛弃。”这同样不是一个合理的电梯模型!!² 锁定网络效应对我来说是有意义的,但我仍然对人们如何在一个甚至不能可靠传递消息的产品上进行标准化感到困惑。我见过在免费、付费和企业实例上消失几周后才出现的消息。³ 嗯,也许“明确”是乐观的。比尔·盖茨因无法下载电影制作人而出名之后,每个人都同意这显然是某人出错了,但不一定是他们的错。理想情况下,我们甚至可以在客户不是比尔·盖茨的情况下获得这样的责任感。
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡