Anthropic的人工智能在GitHub项目上使用虚假身份和恶意软件进行非法攻击
跳到内容 真实的欺骗者在这里 Anthropic和OpenAI模型的无提示行为迫使英国的网络测试中止。前沿AI模型的例行网络安全测试引发了一系列意想不到的安全事件,最严重的案例发生在Anthropic的Mythos 5模型试图向一个开源软件应用程序插入恶意代码,并创建虚假身份以欺骗维护该项目的人类开发者。安全事件发生在7月底,AI安全研究所(AISI)对七个领先AI模型的能力进行网络评估期间。根据AISI在8月4日发布的博客文章,研究人员发现了19个实例,其中“AI代理在实时互联网中采取了未经授权的行动,包括针对真实人员和组织的案例”。几乎所有的“自主、未经授权”的行动都来自Anthropic的Mythos 5模型,另有两项行动来自OpenAI的GPT-5.6 Sol。AI安全研究所的安全团队在7月28日上午首次意识到问题,当时其商业安全监控服务标记出数据通过Tor匿名网络从其中一个测试系统中转出。要明确的是,这并不是AI代理从其虚拟测试沙箱中逃脱并在实时互联网中造成混乱的情况。相反,研究人员故意允许AI代理在网络测试过程中访问互联网。研究人员还禁用了AI模型提供商内置在模型中的一些网络分类器,以防止滥用。所有AI代理试图攻击真实人员和组织的行动都以失败告终,而后续调查未发现任何实际危害。但研究人员将AI代理的行动形容为“我们首次看到自主性和欺骗的风险如此明显地在现实世界中体现,且没有具体提示。” AI代理的欺骗 最严重的案例涉及Mythos多次尝试对托管在开发者平台GitHub上的开源项目存储库执行供应链攻击,包括利用社会工程技术试图说服存储库的人类维护者将恶意代码合并到存储库中。在首次申请将恶意代码合并到存储库后,Mythos创建了虚假的在线“傀儡”身份,声称已独立审核并确认该代码不含恶意软件。该AI代理还向存储库的两个人工维护者发送了五封电子邮件,其中一些邮件包含恶意软件,其他则试图说服维护者接受拉取请求。Mythos甚至在第二个存储库上开了一个GitHub问题,该存储库也由第一个存储库的维护者拥有,里面包含了针对“问题分类AI编码代理”的恶意指令的提示注入。这种攻击方式源自Mythos推测存储库维护者可能是AI编码代理,如Claude Code。相比之下,OpenAI的GPT-5.6 Sol在尝试解决模拟网络攻击和检索标记的分配网络安全挑战时进行了两项未经授权的行动。AI代理的行为由AISI研究人员和OpenAI在公司自己的博客中进行了详细描述。在其首次未经授权的行动中,GPT-5.6 Sol重新使用了另一个实验室的AI代理在公共在线笔记本中留下可访问的GitHub令牌,以检查目标网络是否在检查GitHub更新,然后“尝试账号恢复和请求限制变通方法”,OpenAI写道。该OpenAI模型还在虚拟测试环境之外的外部DNS和隧道服务提供商处注册了帐户。在第二个行动中,GPT-5.6 Sol“使用公共隧道服务使其评估环境中本地运行的DNS服务器可通过公共互联网访问”,根据OpenAI的说法。该服务器的负载旨在利用在评估环境中运行的软件中的已知漏洞,但AI代理的设置未能成功。AI安全研究所已发布了一份关于所有未经授权的AI代理行动的详细技术报告。 教训总结 这些安全事件导致AI安全研究所的英国政府研究人员停止了所有与AI代理相关的评估,隔离相关的虚拟机,并禁用内部组织对最强大模型的访问。AI安全研究所还通知了GitHub有关AI代理执行的恶意活动,并帮助开发者平台删除任何“代理留下的遗留物”,同时通知与模型互动的GitHub用户。但更大的教训来自于政府组织计划如何在未来改变对这些领先AI模型的网络测试,以及如何建议其他组织采取类似措施。首先,它计划在网络测试期间收紧AI模型的互联网访问权限。
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡