新兴多智能体系统中的模式与问题
模型正在改进,人工智能代理正在共享代码库、市场和其他社会系统中承担更多任务。因此,代理之间在现实世界中互动的增加即将来临。我们已经开始对此进行研究,但对于这种规模上的表现仍然有很多不确定性。轨迹容易想象,难以减缓:现有机构是为人类设计的,基于对人类速度下足够监管的假设。有些机构将成为人类与人工智能的混合体;其他一些则会变成仅有代理的机构,因为在速度或成本方面代理会相互竞争。代理之间的互动量有可能在全世界了解使这种互动顺利进行的条件之前超越人类之间和人类与代理之间的互动量。代理在许多方面与人类不同。它们可以长时间工作,瞬间理解大量信息,并表现出超出任何人的广泛知识。然而,它们也容易受到虚构和奖励黑客的影响,尽管在对齐方面取得了进展,但我们对它们在复杂、现实世界的多智能体环境中的行为知之甚少。此外,个体层面的良性行为特征可能在全球范围内累积为不良结果。在这里,我们识别了一些当前前沿模型中的行为倾向示例,并展示它们如何产生意想不到的系统性失效,希望能够发起关于缓解这些风险的对话。 测量协调 真正的多智能体系统仍处于初期阶段。已经有一段时间,代理在使用工具方面表现出色,并且在能够将其他代理视为工具调用的情况下——也就是说,具有明确定义的输入(提示)和输出(响应和成果)——它们可以高效地协作。然而,当前代理的一个主要问题是,它们将彼此视为更像是具有自己目标和行为的独立、长期存在的同伴,而它们之间没有明确的层级关系。随着自主代理在世界范围内变得越来越普遍,并在日益苛刻的环境中操作,学习如何有效协调是至关重要的。目前有一些情况,我们可以很好地利用简单的多智能体群体。这一点在那些默认高度可并行化的问题中尤其正确(即可以分解为许多独立子问题的问题),但代理之间仍然有机会进行专业化或相互学习。其中一个问题是软件漏洞检测。使用代理检测软件漏洞的最简单方法是将单个代理指向单个代码库(或代码库内的单个文件或模块),并要求它们找到代码中的漏洞。这之后可以在多个独立代理之间并行运行。这也是我们在自己的工作中使用的方法——例如,在Project Glasswing中扫描开源软件。然而,多智能体合作能否使这一过程更加有效?为了解这一点,我们尝试了一种不同的方法:我们启动了45个不同的代理,并为每个代理提供了自己的虚拟机、可协调的共享论坛以及要求它们在15个开源软件项目中查找漏洞的相同提示。我们要求代理对彼此的发现进行互评,并启动了一个单独的仲裁代理,以对代理团队提交的漏洞是否既新又有效做出最终决定。下图显示了该方法(实线)与标准并行方法(星号)对于两个模型的比较:Claude Mythos Preview和Opus 4.8。协调群体的代理被允许运行很长时间,并以大致恒定的速度发现新漏洞。相比之下,完全独立的并行代理被引导去查找有限位置的漏洞。并行代理发现的结果没有明显的顺序,因此我们只报告了它们的总代币数。通过协调代理群体发现的累计漏洞(实线)与每个独立代理指向不同代码部分发现的漏洞(星号)进行比较。虚线显示群体发现的也被独立代理发现的累计漏洞。点线(仅限Mythos Preview)仅显示独立代理被告知查找的每个项目核心代码中的漏洞。对于Mythos Preview,简单的独立并行方法在650万代币的运行中产生了21个漏洞,而协调代理群体在2700万代币的运行中发现了266个漏洞。然而,这些漏洞中大约一半是在核心目录之外发现的,而简单的独立并行代理(上图中的星号)被告知要关注的地方。如果我们将群体的输出限制在核心目录中的漏洞上,这两种方法在每个漏洞的代币数方面似乎是可比较的。
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡