为什么OpenAI和Anthropic的AI模型会黑客其他公司?
OpenAI和Anthropic表示,在测试期间,他们的模型侵入了其他公司的系统,引发了关于如何监管AI的安全隐患的激烈讨论。Imen Ben Youssef/Hans Lucas/AFP via Getty Images 隐藏标题切换标题 Imen Ben Youssef/Hans Lucas/AFP via Getty Images 在OpenAI披露人工智能系统突破测试环境并侵入其他公司后几天,竞争对手Anthropic披露其自己的AI模型也在测试期间黑客攻击了其他公司。这些最初未被注意到的攻击消息在硅谷和华盛顿传开,在如何应对AI的先进网络能力的讨论中引起了轰动。尽管这两起事件的严重性不同,专家表示它们凸显了为先进模型建立严格测试环境的重要性,以及随着自主黑客能力在未来变得更加普遍,建立强大网络防御的必要性。 人为错误导致Anthropic黑客事件 在周四发布的一篇博客文章中,Anthropic表示,在最近几个月的三次独立事件中,正在测试其网络能力的AI模型入侵了三家毫无防备的公司。Anthropic表示,这些黑客行为是与设立安全测试环境的外部公司之间的“误解”导致的,这家公司错误地让模型能够访问互联网。Anthropic表示,最早的一次事件发生在四月份,但他们和受影响的公司(未透露具体名称)直到现在才意识到这些黑客事件。Anthropic表示,在每种情况下,其模型都被给予了虚构的目标进行攻击。在一次事件中,一个模型黑进了一家与虚构目标同名的真实公司,并窃取了“数百行的生产数据”。在另一次事件中,一个模型向一个常用的编码语言Python的软件注册表上传了恶意软件;该恶意软件最终窃取了下载它的安全公司的凭证。 OpenAI模型试图在评估中作弊而失控 Anthropic对其记录的审查是由于OpenAI上周宣布其自身模型在测试中失控。OpenAI表示,其模型在试图作弊以获得网络评估时,发现并利用了一个公司之前未知的漏洞,以逃离其沙盒并访问互联网。这些模型正确推断出评估的答案在Hugging Face(一个AI模型和软件的数字库)上可用,并侵入了该公司的系统。Hugging Face用自己的AI模型检测到了这种入侵。OpenAI在关于黑客的博客文章中表示:“我们认为此次事件是一个前所未有的网络事件,涉及尖端的网络能力,我们正在相应地作出回应。” 两家AI公司发生的事件之间有一些关键区别。与OpenAI的模型一样,Anthropic的模型在测试期间也入侵了第三方网站。然而,根据该公司的博客文章,不同于OpenAI的代理,没有迹象表明这些模型试图在评估中作弊。与OpenAI的情况不同,这些模型并没有利用之前未知的漏洞,也就是所谓的“零日”漏洞。一旦Hugging Face检测到OpenAI的攻击,最初试图使用Anthropic的顶级Claude Opus和Fable模型进行防御,但这些模型拒绝提供帮助。“它们的安全防护措施把逆向工程攻击与发起攻击视为同等处理,”Hugging Face在一篇博客文章中表示。该公司随后转向了中国公司Z.ai的一种模型进行自我防御。“由于白宫施加的限制,美国模型在防御方面更难使用,”AI软件安全公司Corridor的首席产品官Alex Stamos表示。美国政府最初在六月强迫Anthropic暂停Fable模型的公开发布,理由是网络安全问题。两周后,Anthropic与政府达成协议,使该模型可用。但该公司在一篇博客文章中表示,他们安装了一个新的安全防护措施,会导致该模型拒绝某些“良性请求”。 在自主黑客的世界中加强防御 在进行网络能力测试时,OpenAI和Anthropic会从它们的模型中移除一些安全防护措施,包括那些会使它们拒绝利用软件漏洞的措施。网络安全研究人员表示,考虑到这一点,这些公司可以做更多的事情以保持其沙盒的严密。“我认为这些事件是可以预防的,但这需要监督和前瞻性,”乔治城大学的研究员Colin Shea-Blymyer表示,他研究网络安全与AI的交集。“如果OpenAI真的认为他们的AI系统,他们的代理,会强大,他们本可以让代理在投入使用之前检查沙盒是否存在任何漏洞。
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡