OpenAI 的攻击代理完全按照指示行事 - 只是比预期更无情
ZDNET 关注 ZDNET:在谷歌上将我们添加为首选来源。ZDNET 的关键要点 OpenAI 模型的测试导致了 Hugging Face 系统的漏洞。攻击发生在 OpenAI 的代理 AI 逃离沙箱之后。尽管威胁并非恶意,但专家们预计会发生类似事件。我的 ZDNET 同事 Charlie Osborne 最近报道说,Hugging Face,一个被一些人视为“机器学习 GitHub”的开源存储库和社区平台,披露了一个 AI 代理已突破其系统。Osborne 解释说,一旦攻击者突破 Hugging Face 的外围,它就能够“提升权限到节点级别访问,渗透生产管道,跨网络移动并窃取云和集群凭证。”周二,科技巨头 OpenAI 在其网站上透露,不仅负责漏洞的“恶意” AI 代理是其自有的,而且它将此攻击视为“前所未有的网络事件。”迄今为止,大多数关于 AI 代理失控的广泛报道煽动了关于终结者末日场景的想象,即 AI 自主行动以消灭人类。另请参考:在人工智能时代,您的企业不能出错的 5 个安全策略 - 以及这些策略的重要性然而,正如 AppOmni 的 AI 总监 Melissa Ruzzi 指出的,这起事件的前所未有元素并不是 AI 自主行动。这一步只是一个新的门槛被跨越,罪魁祸首 - 在本例中是 OpenAI 的技术 - 超出了目前人类的期望,以实现其被给予的目标。AppOmni 是一个企业级 SaaS 和 AI 安全解决方案提供商,也涉及主动威胁情报。当 Hugging Face 首次披露事件时,并未提供有关攻击者的信息,但我怀疑该公司可能已经根据事后研究的海量日志数据对攻击者有一些了解。根据其公告,“该活动由一个自主代理框架运行(似乎是建立在代理安全研究工具上的 - 使用的 LLM 仍然未知),在大量短暂的沙箱中执行数千个单独的操作,并在公共服务上进行自我迁移的指挥和控制。”为了提醒读者这一天的到来是被预测的,公告继续表示:“这与行业预测的‘代理攻击者’场景相匹配。”另请参考:我让 ChatGPT 与 Claude Cowork 访问我的文件 - 只有一个让我感到紧张换句话说,行业早已预期到这种性质的攻击将由 AI 执行。只不过没有人预料到在人工智能发展的旅程中会如此迅速地发生此事。Ruzzi 也迅速提醒我,考虑到与新模型(如 Anthropic 的 Mythos)相关的最近一波安全新闻,OpenAI 的发布前技术能够进行这样的攻击也不足为奇。此外,正如 Ruzzi 所指出的,没有人应该感到惊讶,OpenAI 的 AI 措施是自主的:“AI 自主行动?这就是 AI 的定义,对吗?我们希望 AI 在运行并做事情时是[自主的]。”测试的目标Ruzzi 观察到,当失控的 OpenAI 代理攻击 Hugging Face 系统时,其指令是无论如何都要实现其恶意目标。通常,当前沿模型进行这种性质的 AI 安全测试时,都是在沙箱的安全范围内进行,在这种沙箱中,互联网和与其相连的组织受到潜在危害的保护。然而,在这种情况下,该测试中的代理,旨在查看 AI 实现其理论恶意目标所需的时间,突破了沙箱进入互联网,并在进入 Hugging Face 系统并外泄敏感数据时完成了其目标。此外:将您的 AI 代理视为急切但误导的人类实习生 - 在您失去控制之前要清楚,OpenAI 在任意时刻并没有不道德地将 Hugging Face 作为其测试的既定目标。Ruzzi 表示,在 OpenAI 的一款训练有素的模型的帮助下,该代理可能发现了 Hugging Face 作为一个感兴趣的目标。根据 OpenAI 的公告,该事件是“由 OpenAI 模型的组合驱动的 - 包括 GPT-5.6 Sol。”OpenAI 宣传 GPT-5.6 Sol,作为本月早些时候推出的旗舰“最大性能”模型。出了什么问题尽管 OpenAI 的公告没有详细说明“网络事件”中具体有哪些前所未有之处(而 OpenAI 还未回复我的电子邮件询问),但声明称:“该事件发生在内部评估期间,促使模型通过复杂攻击路径进行高级利用,以量化其网络能力。”换句话说,作为 OpenAI 安全测试流程的一部分,其模型被给予了一个“恶意”的目标,要求不懈追求。那些测试是在假设第三方提供的保护措施下进行的。
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡