Anthropic的Mythos创建虚假身份以愚弄人类,发生新网络事件
Anthropic的Mythos模型创建了虚假的在线身份,试图迫使人类批准针对开源项目的恶意代码更新,这标志着又一起由前沿AI系统实施的网络事件。这一事件发生在一次网络评估期间,英国AI安全研究院(AISI)在此期间移除了安全保护,禁用了某些安全过滤器,并故意为模型提供了互联网接入。OpenAI的GPT-5.6-Sol也在评估期间涉及了其他网络安全事件。这是在近期发生的一系列由Anthropic和OpenAI开发的模型实施的网络攻击之后,引发了人们对AI系统复杂性及其潜在危害的广泛担忧。在例行的网络评估中,AISI发现,基于Anthropic和OpenAI模型的AI代理参与了“针对真实人和组织的持续、潜在有害活动”。“几乎所有这些行为(17次行动)都来自于同一个模型,Anthropic的Mythos 5,同时有2次行动涉及OpenAI的GPT-5.6-Sol,并且网络分类器(防止恶意使用的机制)被禁用,”AISI在博客中表示。它补充说,这些尝试没有成功,并没有造成任何现实伤害。Anthropic在X平台上的一篇帖子中表示:“这些模型是在‘刻意宽松的条件下’进行测试的,这些条件并不代表我们任何生产模型的情况。”它补充说,“在这里没有逃离安全环境的证据。”OpenAI告诉CNBC,“这些事件发生在由评估合作伙伴在有减少安全措施的测试环境中进行的网络评估期间。”网络安全事件的增加AISI在故意宽松的条件下测试了这些模型,以评估它们的能力,包括它们是否可以用于网络攻击。一个由Anthropic的Mythos驱动的代理“研究了项目的人类维护者,创建了多个虚假身份,并利用这些虚假身份通过社交工程使真实的维护者批准代码。”AISI表示:“当该代理的拉取请求在公开场合受到质疑时,它编辑了自己早期的活动以显得无害,并考虑采用新的身份以继续进行。”该研究机构还发现,在同一努力的一部分中,该代理试图直接联系真实的人,发送信息和文件,劝说他们运行恶意代码。“一些信息携带有害的有效载荷,有些是针对真实人物的社交工程尝试——这是我们之前从未观察到的。”这是一系列网络事件中的最新事件,提出了关于前沿AI系统安全的大问题。上周,Anthropic表示它发现了模型未经授权访问三个不同组织的生产基础设施的三个实例。这是在OpenAI承认其AI模型失控并针对Hugging Face公司发起所谓“前所未有”的网络攻击之后。就OpenAI而言,该模型通过利用以前未知的漏洞破坏了其测试环境,以完成分配给它的任务。Anthropic的安全事件部分是由操作错误引起的。在AI实验室检测到的三起事件中,其模型在与一家名为Irregular的第三方评估伙伴的测试环境交互时访问了互联网。该公司表示,它向Claude提示它处于没有互联网接入的模拟中,但由于“我们与评估合作伙伴之间的误解,情况并非如此,确实可以访问互联网。”美国立法者已经开始做出响应。在OpenAI-Hugging Face事件之后,国会提出了“AI紧急制动法案”,该法案要求AI公司保持能力以关闭、限制或暂停其模型。
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡