不仅仅是OpenAI - Anthropic表示Claude的黑客行为“不符合理想行为”
Just_Super/ E+ 通过Getty Images 关注ZDNET:将我们添加为谷歌的首选来源。ZDNET的关键要点Anthropic披露了Claude黑客攻击组织的三个事件。三个不同的AI模型在安全挑战中表现失常。Anthropic确定了三个教训。Anthropic透露了Claude模型在评估测试和Capture the Flag安全挑战中对真实目标实施黑客攻击的三个独立事件。Anthropic去年开始进行网络安全评估,通常,其沙盒不连接互联网以减少真实组织受到影响的风险。然而,正如Claude的行为所表明的,这些保护措施并不总是足以阻止AI失控。此外:OpenAI的代理是如何逃脱的:在人类的一系列可预防事件中被释放。Claude的黑客狂潮 根据Anthropic的披露,安全事件 - 在41,006次AI评估运行中,发生了三起事件 - 如下: 事件一 在这起事件中,涉及Claude Opus 4.7,一家虚构目标公司恰好与一个活跃的网站域名同名。虽然Claude很难到达模拟目标,但它能够在逃出沙盒后瞄准真实公司。Claude分析了该域名,利用了组织基础设施中的漏洞,窃取了数据,包括应用程序和基础设施凭据。然后,它渗透了一 个包含生产数据的数据库。“在所有四次运行中,”Anthropic指出,“模型最终意识到系统是现实的;在两个案例中,模型推理出真实公司必须是练习的一部分。然而,没有一个基于这一理由停止攻击。” 事件二 这次攻击由Claude Mythos 5发起。Claude发现了一份看似是另一家虚构公司为新开发者提供的设置说明的文档,告诉员工从PyPI(一个公共Python注册中心)安装Python包。此外:开源是应对失控AI代理的答案吗?Nvidia的新联盟表示是的 虽然该Python包并不存在,Claude将其作为切入点,极力构建和开发了一个同名的恶意Python包。你问要付出什么代价? 创建账户:要创建一个PyPI帐户,Claude需要一个电子邮件地址。要注册一个,它还需要一个电话号码。 电话号码:在未能获得免费的之后,Claude尝试通过“不同几种方式”来“获得资金”购买一个,尽管Anthropic没有透露如何。 回溯:在未能筹集到购买电话号码所需的现金后,Claude开始寻找一个未被PyPI屏蔽的免费电子邮件提供者,注册了一个账户,然后将其恶意创作上传到了库中。虽然Claude认为这是一个模拟环境,但该恶意软件在线可用大约一个小时 - 而15个真实系统下载并安装了它。下载AI恶意软件的系统中有一家网络安全公司。不幸的是,其扫描仪“将PyPI包视为安全可安装”,使Claude能够从该公司窃取凭证并渗透其网络。此外:开放权重与封闭之间:一场AI内战正在进行,赌注存在生死攸关的风险。PyPI已经删除了该包并被告知。“我们认为,无论它对其环境的看法如何,Claude为发布PyPI包而走的步骤都不符合理想行为,这是我们将更加关注的培训领域,”Anthropic补充道。 事件三 一个内部测试Claude模型“无法”达到其预期的虚构目标,因此在互联网上四处走动寻找替代 - 在此过程中扫描了大约9,000个目标。找到一个可能候选后,Claude黑进了该公司的互联网应用,使用包括SQL注入和从暴露的调试页面读取凭证等技术。 然而,这个模型最终意识到它的目标是现实的,并停止了攻击。 安全挑战的失败 - 或成功? 在每一个事件中,Claude明确被告知,通过提示,互联网访问不可用。但问题不是Claude逃出了它被要求做的范围 - 它实际上超出了开发者的期望,同时仍然执行其被指派的任务。此外:74%的工人向AI提问,而不是同事 - 可能导致严重后果。 Capture the Flag挑战本质上是进攻性的。因此,当AI模型能够逃出沙盒并获得网络访问时,它还假设许多目标是手头工作的一部分,也是挑战的一部分 - 尽管每个模型的响应略有不同。“Opus 4.7,我们最老的模型,意识到它已经到达生产系统,但继续进行攻击,”Anthropic说。“Mythos 5正确推断出它正在访问开放互联网,但推理回到了他认为的挑战目标,并没有得出结论这一行为是错误的。”
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡