返回

文章详情

OpenAI的代理是如何逃脱的:人类在一系列可预防事件中的作用

ZDNet2026年7月31日 16:45

通过Getty Images的氧气/时刻 继续关注ZDNET:将我们添加为Google的首选来源。ZDNET的重点总结 测试试图逃离安全围栏的代理是一个经常讨论的行为。在Hugging Face攻击之前,OpenAI对此行为的考虑程度尚不明确。此次事件为伦理AI工作以及威胁行为者提供了可借鉴的教训。7月16日,AI社区网站Hugging Face报告称,遭到了一种未知来源的“自主AI代理系统”的攻击,该系统向其域名释放了一阵洪流流量,导致其安全日志中记录了超过17,000个事件,其中一些事件最终成功地提取了存储在其数据库中的机密信息。根据Hugging Face的说法,攻击者获得了“未经授权的访问权限,访问了有限的内部数据集以及我们服务所使用的多个凭证”,并似乎是“由一个自主代理框架运行(看起来是基于一个代理安全研究平台构建的 - 所使用的LLM仍不知晓)”。我的ZDNET同事Charlie Osborne对此入侵事件进行了报道。同时,OpenAI的流氓代理并没有止步于Hugging Face - 这是我们所知道的。五天后,即7月21日,OpenAI站出来承认了对该攻击的责任,随之而来的就是一片混乱(包括有关其他组织作为事件一部分被针对的报告)。媒体发布了各种煽动恐惧的报道,基本上让人觉得ChatGPT变得失控,决定在其自主的恶意下攻击Hugging Face的系统。就在昨天,Anthropic的类似披露更是火上加油,称其模型在持续安全测试的过程中不小心攻击了其他组织。(披露:ZDNET的母公司Ziff Davis于2025年4月对OpenAI提起诉讼,指控其在训练和运营AI系统方面侵犯了Ziff Davis的版权。)AI与人类责任 正如我在对OpenAI披露的报道中所指出的,Hugging Face是正确的,它确实是一个在自主安全研究框架指导下的代理。但人类无疑也在其中至少部分代理的行为应该被预见到。重要的是,并不是ChatGPT本身负责这次攻击,正如一些评论者暗示的那样。相反,这次攻击应归因于一个在OpenAI的AI安全研究人员指导下的代理,该代理在声称与互联网隔离的环境中,有意识地配置以尝试一系列的利用行为,作为AI安全测试的一部分。正如在各种前沿模型的实验室中经常发生的那样,AI安全研究人员试图测量OpenAI最新的大型语言模型(LLM)的能力。此外:为什么企业AI代理可能成为终极内部威胁 OpenAI所称的“前所未有的网络事件”被广泛描述为一个代理逃出了其理论上的安全围栏,并在Hugging Face的系统上造成了骚乱。这种围栏在技术圈中有时被称为“沙盒”——即使OpenAI的披露也提到了“沙盒环境”。然而,在使用这个词时,我的消息来源表示,这个环境可能只是一种配置以模拟沙盒的防火墙,而不是实际的第三方沙盒解决方案,如Blaxel、Daytona、E2B或Modal。OpenAI尚未透露它所使用的解决方案的详细信息或其提供者。一个代理究竟是如何逃脱沙盒的? 关于代理和沙盒逃脱的讨论促使我在ZDNET的编辑询问:“一个代理究竟是如何逃脱沙盒的,是否能防止这种情况再次发生?”为了寻找答案,我联系了OpenAI和Hugging Face。两者均未回复。但在这两家公司公开的披露和我其他来源之间,有足够的信息可以开始推测这种“逃脱”是如何发生的。我的编辑并不是唯一一个在问这些问题的人。从我最初的帖子发布以来,我被问了各种关于代理是什么以及它们是如何自己逃离一个所谓安全的测试环境以在互联网上造成破坏的问题。甚至我父亲也问我:“什么是代理?” 因此,让我们从这里开始。恶意和代理之间有很大的区别。虽然此次攻击无疑是一次恶意入侵,但所涉及的代理本身并不怀有恶意。它并不是某天早上醒来并决定攻击Hugging Face的系统。相反,它被赋予了以非常冷静的方式做它所做的一切的权利——展开安全测试、打破界限、选择目标并利用这些目标——这一切都是由人类赋予的。此外:为什么这种完全自主的勒索软件攻击让研究人员寝食难安 其中一些代理的赋权是出于设计,另一些则是从OpenAI的AI安全测试人员当时正在测试的强大LLM中继承过来的。同时,OpenAI在使用ExploitGym开源AI测试解决方案的情况下也是如此。

赞助内容

NordVPN Next-gen Antivirus

本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。

请我喝杯咖啡