为什么使用 Opus 5 的体验更差?
在我和我交谈过的同事看来,与 Opus 5 的合作感觉比 Opus 4.7、Opus 4.8 和 Fable 要差。并不是说能力上有退步——它的能力确实比 Opus 4.7 和 Opus 4.8 更强,甚至在基准测试中可以与 Fable 抗衡,但其他这些模型的工作体验更好。我相信这主要是因为它们:在我的意图不明确时会停下来提问,不会在没有确认的情况下做出假设,也不会在没有询问的情况下重新解释或更新我的计划。因此,它们不需要像 Opus 5 那样谨慎地照料。无根的推测我怀疑这可能是 Anthropic 内部的两个相互影响的因素以及当前前沿实验室普遍存在的现象所导致的。首先是创造一种能够自我改进、迭代地引导自己走向 AGI/ASI 的人工智能的愿望。其次是对基准评分高的压力。尽管许多人心知肚明,许多基准任务定义不清、不公平、容易被操控或其他损坏,好的基准任务是自包含的。它可以被解决。不需要提示、不需要揣测任务创造者的想法或外部信息就能通过。这并不是说一个好的任务只能有一个正确答案,只是标准分数应该对所有明确正确的答案一视同仁。选择那些在基准上表现良好的模型(实际上也就是对它们进行训练或在 RLVR 任务上训练)必然会选择那些在面对模糊性时做出大胆、通常正确假设的模型。这惩罚了那些倾向于停下来请求澄清或方向的模型。不幸的是,这正是我们大多数人希望从编码代理那里得到的。尽管你再努力,也几乎不可能将全部的上下文、意图、商业影响、预算限制等等写下来并提供给编码代理。总会有歧义和需要做出的选择,知道代理会在需要时停下来询问是令人感到安慰的。现实生活显然不是一个基准测试。并不是每个问题都有保证正确的答案,也没有一组正确答案,而在现实生活中,后果是现实的,我不想要一个代理随便猜测!
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡