返回

文章详情

您无法通过忽视界面来解决计算机使用问题

Hacker News2026年7月30日 11:28

钢铁人实验室 · 2026年7月的笔记 目前,主动的计算机使用是现实世界中人工智能影响的最大杠杆之一。基于LLM的代理正在改变软件开发,但大多数知识工作都被软件使用所限制。当编码代理变得如此出色时,自然会问:它们能否在政府门户网站上报税、修复文本文档、测试网站?我们还没有达到那个水平。在OSWorld-V2,一个领先的长期计算任务基准中,最佳模型的完成率仅为20.6%。在代理的最后考试中,最佳结果是26.2%。习惯于在聊天交互中体验LLM出色表现的用户期待在计算机使用中获得类似的结果。但他们却感到挫败:代理不可靠、慢且昂贵。目前,自己动手工作更为简单。在OSWorld-V2的完成(以二进制奖励计算)中,不同模型和推理努力设置下的每个任务的输出token。在大约20.6%的前沿上,额外的每一点奖励都会消耗更昂贵的token。在2024–2025年,几乎所有主要的人工智能实验室都推出了计算机使用原型。当时,这些原型在OSWorld、WebArena、AndroidWorld和WebVoyager等基准上表现出色,任务完成率从60.76%到97.4%不等。这些基准非常适合这些代理。除了少数例外,它们将每个任务呈现为大多数静态环境,具有清晰的文本表示和小型预定义的行动空间——这与混乱界面的现实世界大相径庭。因此,出现了虚高的排行榜以及用户期望与实际表现之间的差距。到目前为止,改善计算机使用的回答仍然是更多的重复:更大的模型和更多的token。在我们看来,这一方向是一条死胡同。现有的方法在舒适的环境中表现不错,但无法推广到实际的GUI工作中。计算机使用的核心缺陷 计算机使用有众所周知的难点,例如感知、规划和在长任务中保持上下文。这些问题正在得到社区的关注,其中一些真正需要更聪明的模型。然而,一个更简单的问题却得不到足够的关注,而这可能是瓶颈:使用界面的代理大多避免使用界面。在OSWorld-V2中,最佳模型往往根本不操作用户界面。在任务052中,要预订酒店套房,GPT-5.5注入JavaScript以读取网站的源代码,找到内部API端点并进行POST预订。在任务065中,要购买火车票,GPT-5.5和Claude Opus都跳过了网站,直接对API进行POST。在任务003中,要在GIMP中合成两幅图像,GPT-5.5用Python编写了脚本。总体而言,大多数任务并没有按预期解决,而是绕过了。在OSWorld任务068中:Claude Opus 4.7并没有通过其UI玩游戏,而是直接处理状态——“通过API将last_score更新为150”——POST分数而不是获得它。这可能被忽视,甚至被视为有利。既然可以进行API调用,为什么还要接触GUI呢?然而,某些工作只能通过UI完成。绕过UI可能会产生意想不到的副作用,因为软件并未设计为以这种方式使用。更重要的是,许多工作通过UI完成要轻松得多——这对于实现经济可行的计算机使用非常重要。点击按钮、填写表单和浏览网站并不是困难的任务。人们做这些事情时不需思考。反向工程一个网站的API、拆解其JavaScript或从零开始编写合成器比取代的点击要复杂得多。直接执行这项工作会便宜、更快且更加可靠。然而,对于前沿模型而言,这不是一种选择。WebGames基准挑战模型完成需要反应时间和平均网站用户运动控制的简单任务。人类的成功率超过95%,但尽管模型智能,仍远远落后。这一差距不通过增加token或参数来缩小。这就是为什么在长期任务中,模型寻求困难的解决方案:它们没有以人类水平使用接口的能力,因此不得不绕过这一限制。这导致计算分配不理想。代理大多数时间将他们的动作花费在感知和动作上。OSWorld 2.0中的图10细分了动作预算:视觉基础、低级操作和工具使用开销占据其余的主导地位。规划如何解决任务应该比点击按钮更难,但大多数计算用于观察和点击。推理、反思和错误恢复得到剩余的部分。图10,OSWorld 2.0 — 各模型的行动预算类别份额。感知和动作占主导地位;推理、反思和纠正获取剩余部分。在我们看来,这就是主动计算机使用的核心问题:我们用万亿级别的推理器来绕过点击。适当的操作将使代理能够将精力放在解决任务上,而不是绕过界面限制。

赞助内容

NordVPN Next-gen Antivirus

本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。

请我喝杯咖啡