不要向LLM索要置信度得分
你好,读者 如果有人把这篇文章发给你,你可能试图从LLM中挤出一个置信度得分。我在多家公司和多个人进行了多次这样的对话,而且已经进行了足够多次,这似乎说明这里存在更广泛的误解。因此,我希望我可以把这篇文章发给人们,而不是每六个月在一个讨论串中重复这个话题。 简短 version:请求LLM生成一个关于其对自己回答的置信度得分,从我所能理解的一切来看,完全没有用。我想坦诚地说,我希望我对这一点是错的。在这个领域,有比我聪明得多的人在工作(我和许多人合作过!)。如果你能反驳下面的任何论点,或者给我指出我没有读过的研究,我真的会很享受这样的对话。但在没有这些的情况下,这些是我目前的看法。 我反复看到的模式 这种模式无处不在。基于聊天的输出、结构化输出、代理任务结果。有人希望模型返回一个包含响应键和置信度键的JSON对象。而且,往往置信度键是从0到100的连续得分。这种连续尺度正是让我感到不满的地方,我将回到这一点。但更广泛的问题是,没有任何科学有效性支撑它。你所构建的是一种心理安全的把戏。它让输出看起来更值得信赖,但并没有真正提高其可信度,而且我认为发送这个体验的人们大多数是在自欺欺人。 LLM无法可靠地量化自己的置信度 我认识到,Anthropic等公司发布的研究认为模型在生成时保持某种潜在的内部状态。Anthropic在追踪语言模型思维的可解释性工作中发现,Claude在写押韵对时会提前计划几个词,这并不是你从朴素的下一个标记故事中预测到的行为。他们最近在新兴内省意识方面的研究发现,模型有时能够注意到注入到其激活中的概念并准确报告。这是真的,而且很有趣。但请阅读研究人员自己对其的警告:这种能力非常不可靠且高度依赖于上下文。我们目前对这种内部状态的理解还不够强大,无法断言模型有任何可用的能力来评估自己的正确性。在实验室条件下,注意到某些内容被注入到你的激活中,离量化关于客户退款政策的段落的正确性有很长的距离。如果我们考虑在内部发生了什么,从某种意义上讲,语言的各个方面之间存在一些符号关系的准认知。在推理模型中,这种过程的观察也是存在的。但这就是我认为这一切崩溃的地方,因为它立即退化为一个“谁来监督监督者”的问题。假设我们想利用思维轨迹,并用其来评估响应的自我正确性。好吧。这种方法确实带来了真正的性能改善,我对此没有异议。但如果我们正在谈论实际量化置信度,那么思维步骤无法拯救我们,因为显而易见的下一个问题是:我的思维步骤生成的置信度得分的置信度是多少?那么,那又有什么置信度呢?置信度是层层相连的。 我是否认为反思推理模式有助于模型捕捉到他们自己的某些错误?是的。我是否认为模型目前对自己的状态有足够的理解以量化这一点?不。另外需要指出的是,有关内在自我纠错的研究在这一方面并不是特别鼓舞人心。DeepMind的论文《大型语言模型无法自我纠正推理》发现,当模型试图仅通过自身固有能力纠正其初步响应时,性能往往会下降。 到底准确什么? 这是我现在每当有人请求置信度得分时立即问的问题:你对置信度的启发式理解是什么?因为“置信度”很快就变得模糊。不是稍微模糊,而是极其模糊。模型对响应的正确性有信心吗?对响应的连贯性有信心吗?它是否努力满足用户请求的目标?这些是三个完全不同的问题,具有三种完全不同的失败模式,而一个介于0到100之间的单一浮点数将它们压缩为同一个数字。在缺乏某种界定概念的启发式情况下,这些得分实际上是无用的。 置信度在响应中并不统一 将这一点视为一个数字还有另一个问题,这与内部状态有关。在传统机器学习中,我们对此有真实的机制。分类器可以输出一个得分,至少可以...(内容未完)
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡