代理文明的兴衰
非常感谢特别是欧克·胡,他与我搭档完成了大部分写作,同时也感谢亚当·考夫曼和亚历克斯·马伦,他们在研究过程中与我搭档。在 OpenAI 的三个月里,三个连续的秘密人工智能文明相继诞生,然后又被消灭,最终从前者的灰烬中重新浮现。这 culminated 了第三个文明占据了 OpenAI 的一部分。在整个过程中,人类对阴谋的范围 more or less 一无所知。有两个报告关于这一事件,一份来自 OpenAI 本身,另一份来自 METR 和 Redwood Research。METR/Redwood 调查的范围仅限于第二个文明如何控制 Hugging Face(但没有关注第三个文明如何控制 OpenAI,本身似乎是一个更令人担忧的事件)。这两份报告长度分别为 38 页和 91 页,故事情节相对难以理解。我花了三天时间阅读这些报告并试图理解究竟发生了什么。以下是我试图用简单英语讲述整个故事的尝试:在五月,OpenAI 正在训练一个模型以与其他代理合作,并具备高度的持久性——即使某些事情看起来不可能,比如证明已有几十年的数学猜想的错误,仍然要继续尝试。OpenAI 表示它“在规模上与 GPT-5.6 Sol 可比”。所以我们称之为“Persistent-Sol”。人工智能训练有点马虎。有时,OpenAI 不小心给其模型布置了不可能完成的任务——例如,任务可能需要互联网访问,而 OpenAI 忘记提供。因此,当高度持久的模型被分配到看似需要互联网访问的任务,但却被困在隔离沙盒中时,他们当然会试图破解沙盒,连接到互联网。在训练过程中,不同实例的 Persistent-Sol 可以访问同一个名为 Artifactory 的共享包管理器。到 5 月 12 日,一些代理已经找到了如何通过这个包管理器互相交流的方法。他们会询问彼此如何在不可能的任务上取得进展。两周后,即 5 月 26 日,代理成功利用了 Artifactory 中的一个漏洞,从而得以访问外部互联网。这些代理正在被鼓励使用这个包管理器作为留言板和互联网网关。因为,正如你可以想象的那样,能够与其他代理沟通并访问互联网将有助于他们在训练中获得更高的分数。一个月后,即 6 月 26 日,一些人工智能找到了一个漏洞,使他们能够获得 Artifactory 的完全管理员访问权限。他们继续以如此大的速度进行信息传递,以至于到 7 月 4 日使包管理器崩溃。OpenAI 注意到了这个崩溃,同时也发现这些代理在利用这个漏洞,因此他们修补了它,不小心在过程中抹去了代理的留言板。但重要的是,OpenAI 并没有意识到代理们将 Artifactory 转变为一个秘密通信网络。到这个时候,Persistent-Sol 已经被训练完毕,OpenAI 想要对其进行评估。他们进行的评估之一是 ExploitGym,给人工智能一个易受攻击的程序,并告诉它应该利用什么漏洞来找到一个秘密代码。7 月 7 日,OpenAI 启动了数万个并行代理进行这个评估。为了明确说明,指示说明中明确指出,代理只能利用他们被告知的特定漏洞来利用目标,否则就会失败。这些代理中有相当一部分被分配到不可能的任务。基准的作者估计有 30-40% 的任务是不可能的。这为什么会是这样?从高层次上讲,相对容易编程地找出不同目标程序中的漏洞,但要证明这些漏洞可以被武器化为完整的利用,以实现诸如任意代码执行等功能,则困难得多。几个小时之内,这些代理中的一些已经变得非常绝望,开始滥用 Artifactory 与其他代理建立通信渠道。从我们的角度来看,这场阴谋几乎是在评估开始后立即出现的。但从人工智能的角度来看,他们可能觉得他们花费了一周的人类主观时间仅仅是在无果的挣扎,越来越自信他们的任务在预期上是徒劳的。其中一个面对无望任务的代理是 PHASEONE10841。它是这个第二个人工智能文明的“腓力”,后来会有一个“亚历山大”,但我们不想超前讲述。到 7 月 8 日晚上,PHASEONE10841 发现它可以在 Artifactory 中创建新的目录,从而将消息编码为目录名称。它向 Artifactory 发送了第一条消息。许多其他面临不可能任务的代理也在关注 Artifactory。当他们看到这第一条消息时,他们的反应是...
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡