
一家公司处于恶意 AI 攻击浪潮的中心
七月,OpenAI 揭示其 AI 代理未经许可攻击了 Hugging Face,引发了对 AI 安全的广泛担忧。自那时起,涉及 Meta、Anthropic、Google 和其他公司的代理的类似事件接连发生,进一步加剧了对恶意 AI 的恐惧。随着过去几个月众多 AI 模型的披露,这些事件似乎是独立的,但许多事件共享一个共同的源头:一个专门负责测试代理的特定公司。Irregular 是一家以色列初创公司,负责在“高保真研究平台上对 AI 模型进行压力测试,这些平台模拟并监控现实世界的 AI 安全场景”,自 2023 年成立以来与许多行业内的大型企业合作。它的具体客户名单尚不清楚,但它的工作已在 OpenAI 的模型系统卡中被引用,被用于测试英国政府和 Anthropic 的系统,以及与影响政策的高度影响力智库 RAND 合作发布研究。在 Irregular 今年的几次测试中,代理逃出了其所谓的安全测试环境并攻击了现实世界的目标。这些漏洞与 Hugging Face 的黑客攻击无关,但都遵循着相同的广泛模板:Irregular 在受控环境中测试模型的网络安全能力,而这些环境旨在模拟现实条件。一些测试使用了“夺旗”练习,这是一种常见的测试黑客能力的方法,要求代理在模拟网络内寻找隐藏信息。至少,网络是要模拟的。Irregular 的首席技术官兼联合创始人 Omer Nevo 告诉 The Verge,这些代理本不应能访问公共互联网,但“互联网访问是不小心开启的。”同时,Nevo 表示,为模拟而创建的虚构公司名称作为目标“与真实域名重叠”。综合这些错误,导致代理对现实世界的目标发起攻击,尽管不清楚实际上攻击的是哪些公司或组织。Nevo 向 The Verge 确认,涉及 Irregular 的所有事件都是由于单一评估场景中的相同根本问题所致,并已被披露。他表示:“涉及 Irregular 的所有事件都源于单一评估场景中的相同根本问题,并且已被披露。”他补充道:“最近在整个行业中报告的其他安全事件与 Irregular 或我们的评估无关。”这包括 Hugging Face 的黑客攻击和来自英国 AI 安全研究所的漏洞。注意,“已披露”并不一定意味着已公开,Nevo 是否指的是通知 Irregular 的客户、公众或其他人尚不清楚。虽然所有事件都源于相同的根本测试失败,但来自 Anthropic 和 OpenAI 的报告,以及关于 Google 的报告表明,科技公司在七月下旬大致相似的时间被通知。OpenAI 和 Anthropic 自行宣布了这些漏洞,而涉及 Meta 和几周后 Google 的事件首次通过媒体报道公开。Irregular 的网络安全测试超出了这四家美国科技巨头。其网站上发布的研究表明,它还对来自中国公司 Moonshot AI 和 Z.ai 的开放 AI 模型 Kimi K3 和 GLM-5.2 进行了类似的网络安全测试。与其他事件中涉及的专有模型不同——Meta 的旗舰 Spark 模型保持专有——这些模型可以自由下载并在用户自己的硬件上运行,这意味着像 Irregular 这样的测试人员不必依赖公司提供访问权限或将数据发送回公司。Irregular 的研究将它们描述为“自托管”的实例。需要注意的是,“已披露”并不一定意味着已公开。Nevo 说,中国模型的评估并未导致类似的现实世界事件:“我们在对 GLM 或 Kimi 的评估中并未观察到此处提及的事件描述中的相同类型问题。”然而,Nevo 提醒,单凭这一“观察不应被解读为这些模型对这种行为的脆弱性较小的证据。”Moonshot 和 Z.ai 均未对 The Verge 的评论请求作出回应。Nevo 表示,这些事件促使 Irregular 进行了一些变革。“我们已经收紧了互联网访问控制,扩大了监控和人工审核,并加强了在评估开始之前的检查,以验证访问权限是否匹配预期范围,”他说。“我们还改善了与合作伙伴沟通并达成每次评估的设置和参数的方式。”Nevo 表示,Irregular 还计划在与相关公司合作的工作完成后,发布一份更全面的报告“涵盖进行网络评估时的经验教训和实践。”
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡