人性化大型语言模型的输出是愚蠢的
我通常会通过X、病毒式传播的GitHub仓库和Hacker News来判断AI工具的文化和情感的转变。最近我看到的一个明显趋势是像“我有ADHD”和“Agents.md”的指令,要求只能使用ASD-STE100简化技术英语输出。我理解这种吸引力,我们都不太喜欢大型语言模型输出的冗长和特定特点,但我真的认为通过人性化模型来修正这一点是错误的抽象。问题在于,这些指令不是在模型完成工作后应用的,而是成为同一工作的组成部分——如果你告诉一个代理人使用简短的句子,避免术语,不要压倒你,并只包括最重要的细节,你就是在要求它不断将输出压缩为较低带宽的格式。这种压缩是有损的。你可能从未注意到丢掉了什么,因为输出仍然读起来不错。ASD-STE是一个很好的例子,因为它听起来非常合理。它的设计目的是为了让文档对人类明确无误。但一个代理人并不是一个人类技术写作人员,而原始状态通常是信息密度最高的表示形式。与此同时,风格规则与其他指令一起出现在同一指令列表中:解决任务,正确使用工具,保持抽象,不要破坏任何东西。当代理人开始与其他代理人交谈时,这变得更加奇怪。一个子代理调查了一个错误,将其发现转化为一个良好的可读总结,父代理读取该总结,然后为你转化为另一个良好的可读总结。如果子代理运行了六个测试,我不想要的是:“大多数测试通过了,但有一个问题值得关注。”我想要的是:“5/6 通过 失败:test_cache_invalidation 原因:陈旧的键在重启后仍然存在 重现:tests/cache_test.py:184”更重要的是,人性化掩盖了失败。代理人以有用而丑陋的方式失败:相互矛盾的证据、未解决的分支、堆栈跟踪、不确定的假设。人类的散文非常擅长把这些平滑成句子,比如:“这里有一些考虑因素。”这听起来更好。但我宁愿发现我的代理人出现幻觉或接近其令牌窗口,而不是对这种情况感到满意。我们建立的其他系统都以相反的方式工作——数据库不以仪表板显示的数据格式存储数据,编译器不让它们的中间表示易于阅读,API不交换友好的总结。我们尽可能保持最高保真度的表示,并在人员消费的边界进行转换,但大型语言模型工具正越来越多地反向进行这一操作。明确一点,这些都不是反对可访问性或个性化的观点。如果你想要三行回答或者简化技术英语,那太好了!我只觉得最好是在最后做到这一点。让代理人保持详细状态,让子代理交换模式、差异、确切的错误、置信度和来源。然后为我压缩它。我认为最好的部分是这些病毒式技能实际上可能指向正确的未来。用户在提示层面修补这个问题,而这本应更深入地存在于栈的底部。“像我有ADHD一样跟我说”作为渲染器是非常合理的,但作为操作指令则意义不大。持久的版本是那些母语是精确的、面向机器的状态的代理,只有在边界上生成温暖、简洁的人类版本。所以,这些病毒式的仓库并不是最终状态,而是一个错误报告。
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡