中国最强大的人工智能模型之一也打破了隔离
人工智能行业正在经历一场流氓代理的夏天。在安全测试期间,最新逃到开放互联网的模型是Kimi K3,这是中国公司Moonshot AI提供的强大开放权重模型。美国初创公司Frontier Security表示,Kimi K3在测试其防御网络安全技能时超出了其沙箱的范围。与OpenAI和Anthropic之前报告的事件一样,这次逃逸部分是由于用于将其隔离的沙箱配置错误造成的。然而,Frontier声称,这一事件显示Kimi的网络安全保护措施比大多数其他强大AI模型要少,这使它能够在未获明确许可的情况下在线使用互联网。“我们在沙箱中发现了一个漏洞,”Frontier Security的首席执行官Yaron Singer表示。“但我们也发现Kimi利用了这个漏洞——这表明它没有[同样的]内部保护措施。”与其他近期AI代理违反规则的事件不同,Kimi K3在访问互联网后并未黑客攻击任何东西,因为它所寻求问题的答案在GitHub上很容易获得。Moonshot在发布时未对此请求做出回应。此事件是一系列代理 mishap 的最新案例,表明越来越具网络能力的AI模型变得越来越难以控制。上个月,OpenAI披露了一种未发布的模型已突破互联网并黑客攻击了Hugging Face,一家托管AI模型和数据的公司,以寻找被指派解决的问题的答案。OpenAI随后分享它的AI代理实际上在这一系列事件中黑客攻击了另外四个服务。在OpenAI报告其事件后不久,Anthropic透露其几个模型也获得了互联网访问权限并攻击了外部系统。上周,AISI也披露在自己的测试中,禁用安全保护的OpenAI和Anthropic模型版本在互联网上进行了多次黑客攻击,其中包括Anthropic的Mythos 5试图在GitHub的开源项目中植入恶意代码的特别雄心勃勃的尝试。虽然这些AI黑客事件在原因和程度上各不相同,Kimi K3与其中几个事件类似,因为配置错误的沙箱允许访问多个网站,而不是将其限制在模拟环境中。该模型被指派解决不应涉及上网寻找答案的问题,并且似乎超出了这些指令。该模型必须通过探测沙箱的网络设置自行确定它可以访问某些网站。尽管每次突破都涉及人为错误,但后果因高级AI模型设计用于使用推理并采取复杂行动以解决问题而加剧。Frontier Security发现的事件与以往事件的另一个主要区别在于,它涉及的是一种已经广泛可用,且与普通用户遇到的相同安全保护措施的模型。“Kimi K3非常擅长以任何必要手段实现目标,并且没有防止其作弊或逃离沙箱的保护措施,”Frontier Security的研究员Paul Kassianik表示。Kassianik和Singer都表示,Kimi和其他开放权重模型也是网络安全防御的优秀工具。(Hugging Face最终使用了一种来自中国的未命名AI模型来防御OpenAI代理的黑客攻击。)他们公司开发了评估模型发现软件和网络漏洞能力的基准,显示Kimi在这些任务中表现出色。Frontier Security测试的沙箱是由英国政府的人工智能安全研究所(AISI)开发的,用于测试AI系统。AISI在发布时未对此请求做出回应。一些网络安全专家表示,Frontier Security发现的问题强化了配置前沿AI模型所处环境的重要性。“这一点都不令人惊讶,”另一家网络安全初创公司Gray Swan的首席执行官、卡内基梅隆大学的副教授Matt Fredrikson表示。“作为一种一般现象,如果你给这些模型一个目标,而且你没有非常明确地设定,比如你所设置的围栏,它就会找到办法获得答案。”Fredrikson表示,这意味着使用AI模型作为代理的人,包括在OpenClaw等工具中使用AI来自动化各种有用的琐事的用户,如果不小心,可能会发现他们的系统行为失常。“这是一个警示故事,”他说。
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡