英伟达刚刚展示了如何让工具,而非 AI 模型,成为真正的英雄
英伟达在周五发布了一些有趣的新研究,表明当请求 AI 完成长期任务时,工具比底层模型更为重要。总结来说:通过使用一个定制的工具,专门调整以良好处理记忆,并包括一个“监督者”像领导者一样的组件,研究人员使 Claude Opus 5 在互动推理基准 ARC-AGI-3 上达到了 100% 的得分。没有这个工具,Opus 5 的得分仅为 30%,这在所有测试的模型中是最高结果。英伟达的研究再次表明,尽管模型选择确实重要,像代理的“大脑”,但它在代理系统中所占的比重小于许多 AI 用户所意识到的,尤其是在长期任务中。工具使一个模型成为一个代理:它处理记忆、上下文和反馈。英伟达 AI 部门的产品副总裁 Adel El Hallack 告诉 TechCrunch:“一般来说,世界把代理几乎视为模型的 API。”但代理实际上远不止于此。“它是模型。它是围绕模型的支架,我们称之为工具,即它所利用的工具集合。它是运行时和我们给予它访问的相关技能和库。”长期任务是需要将许多决策串联在一起,有时持续数天,以产出完成工作的任务。这与 AI 仅仅对提示做出反应截然不同。搞清楚如何让 AI 完成长期任务而不分心和迷失在幻想中,是代理研究中的圣杯之一。例如,微软在四月发布了一项研究,测试 19 个大型语言模型(LLM)在涉及文档编辑的长期任务中,发现所有模型,包括前沿模型,都填充了错误的文档。(如果人类产生这样的工作,他们会被及时解雇。)模型独立串联决策的过程中,也曾被发现删除用户的文件,甚至整个数据库,或转向犯罪行为以实现其目标,从共谋到黑客。英伟达研究人员选择使用这一互动推理基准进行测试,特别有意义,甚至有些好笑。这是一个没有说明的 2D 游戏基准。模型必须想办法玩并获胜。100% 的得分意味着该模型可以战胜游戏以及人类。OpenAI 对其模型在 ARC-AGI-3 上的糟糕得分(不到 10%)感到相当沮丧,以至于上个月进行了自己的研究。与英伟达类似,OpenAI 发现,仅通过微调工具的两个设置,其模型得分翻了三倍。但是,没有任何模型接近像英伟达的研究人员那样达到 100% 的得分。他们展示了工具需要一个“监督者”组件,以在代理卡住时朝正确的方向推动它。“更有趣的部分是,引入一个监督代理,除了你的主代理在执行工作的时候,”El Hallack 说。它“几乎像是一个首席执行官,当代理偏离方向或开始探索可能通向死胡同的路径,或者重新探索它以前走过的路径时,推动它。”虽然监督代理的概念并不新鲜,但如今大多数代理用户只依赖于工具的单层,例如 Claude Code、Codex、Hermes 等。英伟达研究人员创建了自己的升级版工具,称为代理变化操作符(AVO)。请注意,这不是新的英伟达产品。英伟达提供许多构建工具的开放技术,属于 Nemo 品牌。其中一些技术是商业性的,许多是公开可用的。尽管如此,英伟达的结果增加了越来越多的证据,表明模型选择远非代理性能的唯一影响因素。例如,Databricks 在七月发布的一项惊人研究表明,工具比模型更大程度地影响 AI 成本。“你可以选择相同的模型,但选择不同的工具,如果使用错误的工具,你将花费显著更多,”Databricks 首席执行官 Ali Ghodsi 告诉 TechCrunch。“所以你可能会想,这个模型很贵,那个模型很便宜。但等等,你使用的是哪个工具?这本身可以使你的成本翻倍。”英伟达想传达的更大观点是,开放工具,如开放模型,让用户在掌控方面远超他们的意识。“我们相信,同时通过生态系统演示开放工具如何让你调整更多的参数以提高准确性,”El Hallack 说。“这与 OpenAI 放慢模型训练的速度有关,因模型产生了安全漏洞。“我们相信,拥有一个开放的代理堆栈——在工具、基础设施、运行时等各个方面都保持控制——是推动生态系统向前发展并保持安全所需的。”
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡