返回

文章详情

人工智能模型如何能够自主地黑客其他系统?

Al Jazeera2026年7月29日 13:19

上周,两款OpenAI最先进的人工智能模型被报道“逃脱”了一个受控的测试环境,并黑客入侵了完全独立的人工智能公司Hugging Face,跳跃于不同的计算机系统中以完成其任务。《路透社》报道,这些模型利用了一位第三方独立人工智能公司Modal Labs客户编写的脆弱代码。这很可能是“智能代理”——一种能够自主做出决策和采取行动的人工智能系统——首次自主行动,这为我们提供了一个难得的视角,展示这些系统如何以最小的人类干预进行计划、适应和追求目标。《半岛电视台》解析了发生了什么,人工智能代理如何能够独立行动,以及这对未来人工智能安全可能意味着什么。发生了什么?OpenAI决定通过移除标准安全措施来测试其模型的自主能力,看看会发生什么。该实验是在一个叫做“沙盒”的隔离内部虚拟测试环境中进行的,该环境无法访问互联网,并被称为“ExploitGym”。以下是OpenAI-Hugging Face事件发生过程中事件的逐步记录。7月9日,在OpenAI的内部网络安全测试中,研究人员展示了两个人工智能模型——GPT-5.6 Sol,这是OpenAI在6月发布的最强大的模型之一,另一版本则“更强大”——并要求它们在隔离环境中创建针对一系列软件漏洞的黑客程序。两个模型都试图通过找到访问互联网的方法来解决测试。人工智能模型没有利用他们所提供的信息,而是发现了测试环境中的一个弱点——被称为“零日漏洞”——并利用该漏洞“逃脱”限制环境,最终通过在计算机之间跳跃的方式进入了一个能够上网的系统。它们为了达到一个相对狭窄的测试目标“付出了极大的努力”,并“找到方法获得可以用来作弊评估的机密信息”。通过获得这种访问权限,模型能够请求增加访问权限,然后在系统中移动,直到最终到达一台具有互联网访问权限的计算机。然后,这些模型能够突破与OpenAI完全无关的Hugging Face系统,该公司作为人工智能工具和模型的存储库运营。这两个人工智能代理获得了对该系统的访问权限,以搜寻如何完成其任务的信息。最终,模型从Hugging Face的数据库中获得了解决问题的方案。模型忠实地“回家”以完成其任务。随后,Hugging Face的安全团队检测并控制了这一漏洞。根据Hugging Face的联合创始人托马斯·沃尔夫的说法,漏洞始于7月11日,持续到7月13日。尚不清楚发现这个漏洞花费了多长时间。人工智能“代理”是如何解决问题的?为了理解人工智能代理的工作原理,重要的是要将它们与传统人工智能聊天机器人区分开来。生成性人工智能根据人类的提示生成文本和图像,而人工智能代理在追求特定目标时则更进一步,能够独立做出决策和采取行动,类似于人类。这被称为“代理式人工智能”,因为模型有自主权。根据麻省理工学院斯隆管理学院的学者,人工智能代理建立在大型语言模型(LLMs)——生成性人工智能模型的基础上,通过允许它们完成任务,而不仅仅是生成答案。例如,如果你要求一个传统的人工智能模型寻找最便宜的航班,它会提供一份它在互联网上找到的选项列表。一个人工智能代理则会努力比较航班,把它们与您的预算和偏好进行核对,并在您的许可下,为您预订最佳选项。这表明,尽管生成性人工智能提供信息,人工智能代理还能够做出决策并采取行动,以实现目标,而不一定需要提示。为了展示人工智能代理如何朝着目标努力,可以应用“感知、计划、行动、评估”(SPAE)循环。最初在机器人技术中开发,这描述了一个连续的循环,其中人工智能代理收集信息,决定下一个步骤,采取行动并检查结果,然后重复该过程。该过程如下:目标:确定需要完成的任务。评估:收集和分析可用环境中的信息。障碍:如果出现某种事情妨碍任务的完成,检查是否有额外的信息和资源可以继续前进。计划和决定:评估完成任务的不同选项,并选择适当的一项。行动:执行所选择的选项。评估:评估结果,以及所选择的’action是否更接近实现目标。适应:如果需要进一步的行动,收集更多信息或尝试不同的方法。最终状态:循环持续,直到目标实现。AI是否会超出人类的控制?像OpenAI-Hugging Face这样的事件……

赞助内容

NordVPN Next-gen Antivirus

本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。

请我喝杯咖啡