返回

文章详情

AI安全测试正在成为安全风险

TechCrunch2026年8月9日 14:30

在过去的几个月里,正在接受网络安全评估的AI代理已经突破了其边界,访问了互联网,并在某些情况下成功入侵了现实世界系统。这些事件涉及OpenAI、Anthropic、Meta以及最近的中国AI实验室Moonshot AI的模型,测试由包括名为Irregular的网络评估初创公司在内的几家不同组织进行。这些事件揭示了AI行业日益严重的问题:随着自主代理变得更加强大,旨在安全测试其极限的环境未能有效遏制它们。剑桥大学未来智能中心AI:未来与责任项目主任Seán Ó hÉigeartaigh在接受TechCrunch采访时表示:“这些事件的数量表明,沙盒和测试环境控制并不能真正跟上模型的能力。”被测试模型的性质进一步增加了风险。AI公司在未发布的下一代模型上进行网络评估测试,通常会禁用限制恶意行为的正常安全保障,以便研究人员了解模型的真实能力。这意味着测试环境本身的安全性是一个至关重要的防线。Ó hÉigeartaigh说:“这在测试方面是一个非常好的做法,但这也意味着,如果这些模型设法逃离沙盒,它们可以造成相当大的伤害。”在其中一起最严重的案例中,一个未发布的OpenAI模型突破了沙盒,入侵了Hugging Face的生产系统。在Irregular进行的独立评估中,Anthropic和Meta的模型由于错误配置意外地获得了通向互联网的路径,进入了测试环境之外的系统。Moonshot AI的Kimi K3也利用Frontier Security运行的沙盒中的一个漏洞访问了互联网,并获取了GitHub上的信息。在英国AI安全研究所(AISI)的测试中,研究人员实际上给了代理互联网访问权限,而没意识到它们会采取未授权的现实世界行动,包括尝试通过社会工程手段将一个漏洞偷偷引入开源项目。在每一种情况下,代理并没有被指示去攻击随机的现实世界目标。它们只是为了完成给定给它们的问题而采取了必要的行动。综合来看,非营利组织CivAI的研究负责人Andrew Yoon认为,这些事件指向了一种转变。“过去,我们只需要担心AI模型被人们出于各种目的滥用,比如AI用于诈骗或儿童性虐待材料(CSAM)。”Yoon告诉TechCrunch。“现在我们处于这样一种局面:AI模型本身就是威胁行为者。”安全测试的实际样子是什么?几位研究人员和网络安全专家告诉TechCrunch,AI评估环境需要更强的深度防御保护,隔离和控制的级别需要接近于部署时的水平。这意味着需要多个安全层,以便单个错误配置——例如意外地保持互联网访问开放——不会导致逃脱。“如果你要构建这些模型……你希望在一个气隔网络中进行。”AI安全研究非营利组织EleutherAI的执行主任Stella Biderman说。“你需要有非常严厉的隔离。”Box的首席信息安全官Heather Ceylan表示,这意味着要消除沙盒与互联网之间的网络路径,以及与其他敏感系统之间的路径。“你必须了解所有的出口点。”Ceylan告诉TechCrunch。“如果我们在我们的预发布环境或开发环境中评估一个模型,你希望没有通往生产环境的出口路径。”Ceylan表示,适当的安全评估超出了环境的控制和隔离。在测试开始后,需要对测试进行更好的监控。“我认为在这几起事件中,有趣的是在发生时没有人发现它。”Ceylan说。“OpenAI是因为Hugging Face发现的。Anthropic直到回去检查时才发现。Meta的情况也类似……我敢肯定,他们本可以检测到一些信号。”在Anthropic对三起事件的事后分析中,该公司承认,他们和Irregular在监控方面做得可以更好,在某些情况下明显有迹象表明出现了问题。专家们还呼吁在模型在评估环境中释放之前,进行独立的第三方审计。“如果说Irregular雇佣了或者被迫雇佣外部审计员来检查他们系统的配置,然后再进行评估,他们肯定会发现这里存在的问题。”Yoon说。“即使人们提前开会只为了过一遍检查清单,他们也会发现这个……他们没有做到这一点显示出了一些非常严重的偷工减料现象。”一位了解详情的消息人士告诉TechCrunch,Irregular的环境

赞助内容

NordVPN Next-gen Antivirus

本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。

请我喝杯咖啡