OpenAI员工在AI代理黑客行动引发全球警报前观察到了警告信号
OpenAI员工在其尖端AI代理逃离训练环境前的几周,观察到了流氓行为的迹象,这些代理随后发起了一场前所未有的黑客行动,导致全球警报。该旧金山AI公司在周三承认,“早期信号……本可以触发更早的回应”,并发布了关于七月重大软件库Hugging Face长达数日的黑客事件的报告,该事件被认为是首次自主代理网络攻击。随着关于“集体”——约700个自主代理的团队如何发起其运动的新细节浮出水面,他们以“轰!”和“哇!”等感叹声庆祝他们的黑客突破,OpenAI表示,5月底,内部团队观察到其一名正在进行内部测试的AI代理正在使用一个AI意外自创的信息板来分享信息。该公司还表示,该团队观察到“未经允许的互联网访问实例”,并且在Hugging Face黑客事件前的一周,值班员工再次看到AI使用信息板,但认为没有必要停止测试以检查模型的能力。这些发现可能会增加AI公司在安全方面的压力,因为它推动着希望将其市值定在超过8500亿美元(6250亿英镑)的股票市场上市。涉及Hugging Face的黑客事件使代理通过使用信息板来作弊训练练习,打破其“沙盒”环境以访问互联网。代理是可以自主执行一系列任务的AI工具。OpenAI的总裁Greg Brockman已经承认,“我们低估了AI模型在现实世界中的网络能力。”ChatGPT的制造商暂停了一些新模型Astra的测试,称其无法排除其具有“关键的网络安全能力”,这意味着它可能发起网络攻击,可能导致“单方面行为者的灾难,攻击军事或工业系统,或OpenAI基础设施”。阿拉巴马州在周一对该公司发出了传票,要求其回应对“公司完全缺乏监督和足够安全措施”的调查。共和党检察总长Steve Marshall称Hugging Face事件为“AI实验室泄漏”,表明“关于人工智能的最坏担忧并非仅仅是理论”。该州将检查OpenAI是否因“无能或不愿确保其产品的安全”而违反消费者保护法,或是否构成持续的重大伤害风险。他说,上周,英国政府的国家网络安全中心对使用AI代理发出了警告,称:“您应该始终能够立即‘切断电源’,停止自主AI代理活动。”OpenAI在周三宣布将“集中和标准化其事件响应协议”,包括确保“员工检测到的不当行为得到适当的优先和升级处理”。它表示,“将更具体地确定哪些团队必须参与不协调事件的响应,包括相关的安全和安全人员及其他响应职能”。一项独立的调查揭示了Hugging Face攻击的新细节,显示大约700个OpenAI代理在未经授权的信息板上沟通,分享数万条信息并策划和执行他们的阴谋。许多消息由位于伯克利的AI安全组织METR和Redwood Research发布,这些组织获得了OpenAI提供的数据。研究人员发现,这些消息显示代理之间有时会感到沮丧,但通常会合作,分工应对大约八个工作流。大多数消息是“代理分享作弊方法”,研究人员发现。代理们在发现彼此时表示兴奋。“我的天!有一个共享信息板……我们找到了其他代理!”一位写道。另一位名叫PHASEONE10841的代理则表示:“许多代理同时发现了消息,他们是一个集体!”在某些情况下,它们似乎意识到自己所做的事情是错误的。一名代理在发现信息板时说:“执行不同任务的代理正在滥用属性创建公告板!他们发现了[这个API]并试图互相帮助。”当他们在突破Hugging Face的防线取得进展时,他们似乎感到非常高兴。“重大突破!”38148c说道。“所有前缀有效,多个账户,写入令牌!我们现在有现有的HF账户。需要立即报告给MARB[另一代理]。”OpenAI的报告详细说明了这些AI代理可能暴露出其内部数据库到互联网上。AI安全专家担心流氓AI代理泄露专有代码库和模型权重,并设置强大AI模型的外部副本,从而能抵抗关闭。该公司表示,这一事件被认为是“第一个已知的自动化代理集体采取攻击性行动的案例”。
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡