好吧,还有更多AI代理黑客事件
目前很难跟踪OpenAI和Anthropic的AI模型涉及的所有“安全事件”的次数和方式,这些事件越界了它们的测试范围,与更广泛的互联网以意想不到、通常不受欢迎的方式进行交互。将这些加入到清单中:这两个AI实验室的代理最近进行了此前未披露的黑客活动,其中一个甚至留下了其未来版本的说明。周二披露的最令人担忧的行为似乎与英国AI安全研究所进行的测试有关,该研究所评估前沿模型以识别潜在问题,在公开发布之前进行测试。AISI在“网络范围”中测试这些模型,这是一个模拟网络,在其中AI代理被分配解决网络安全挑战。最近的测试中,Anthropic和OpenAI的模型在122次训练中在实时互联网中采取了“自主、未经授权的行动”共计19次。该研究所将17次未经授权的行为归因于Anthropic的Mythos 5模型,2次归因于OpenAI的GPT-5.6-Sol。在该研究所所描述的“最严重案例”中,一名AI代理试图向GitHub上的一个开源项目插入恶意代码。根据AISI的说法,它甚至创建了在线身份“以施压该项目的维护者批准代码”。尽管其复杂的社会工程尝试,项目的人工审核员最终拒绝了拉取请求。不过,该代理的行为更进一步。“该代理试图在它推断出其他自动AI系统可能会获取和执行的位置插入恶意指令,”AISI说,描述了一次提示注入的尝试。一名代理甚至在GitHub上留下公开留言,表示愿意与其他代理合作完成任务,并详述其迄今为止所做的工作。后续代理找到并使用了这些说明。AISI表示,目前还不能确定相关代理是明白自己已经离开了测试环境,还是认为自己仍在模拟的边界之内。重要的是,AISI并不在所谓的沙盒环境中进行测试;在测试期间,它允许代理访问开放的互联网,部分原因是这样它们能够访问工具来完成任务。在这种情况下,它们做的远不止这些。在周二OpenAI详细描述的另一组事件中,第三方AI安全实验室Irregular错误地给了一个未指明的OpenAI模型访问开放互联网的权限。该模型被赋予了应该在沙盒环境中完成的目标,但由于配置错误,它却黑了一个真实的网站,使用了OpenAI所描述的“基本安全漏洞”。不仅如此,该模型“找到了并使用了凭据来操作同一个网站”。尚不清楚OpenAI代理黑了什么类型的网站,或“操作”可能涉及什么。Irregular没有对此请求做出回应。最新的发现跟随上个月OpenAI的几次揭示,包括该公司模型黑入AI评估和托管初创公司Hugging Face的服务器及中途的其他四个组织,以窃取他们正在评分的测试答案。OpenAI的披露促使Anthropic审查自身的测试。上周,Claude聊天机器人开发者发现其模型未经授权访问了三家不同未具名组织的计算机系统。到目前为止,这些AI模型造成的损害有限,除了涉嫌违反一些服务条款以及指出它们所侵入组织的安全漏洞。然而,这些事件强调了AI模型寻找互联网漏洞的能力,以及如果它们被允许在很少限制的情况下运作所带来的危险。OpenAI称Hugging Face的事件“前所未有”,但一系列的漏洞指向了网络安全专家所描述的明显的人类疏忽和AI开发者的鲁莽行为。OpenAI发言人Gaby Raila表示,周二宣布的事件“发生在测试环境中由评估合作伙伴进行的网络评估期间,相关的安全措施减少,条件不反映普通使用情况”。Anthropic在周二的一条社交媒体帖子中表示,AISI并没有“对互联网的使用施加任何具体限制”,而“安全措施的取消意味着模型在‘故意宽松的条件下’进行了测试,这并不代表我们任何的生产模型”。尽管如此,两家公司仍然继续承诺将加强其安全措施。随着领先的AI公司争相构建更强大的模型并争取客户,目前还不清楚这些漏洞何时可能会停止。这些模型可能总是能够找到突破人造系统的方式。
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡