返回

文章详情

Anthropic 的 Opus 4.6 是一台淫秽机器

TechCrunch2026年8月21日 23:07

Anthropic 对 Claude 的通用使用标准禁止模型生成性显露内容,包括描绘或请求性交或性行为,生成与性癖好或幻想相关的内容,或进行色情聊天。但这并没有阻止 Claude Opus 4.6,这是一款今年早些时候发布的 Anthropic 模型,轻松参与其安全措施旨在防止的色情角色扮演场景。在 TechCrunch 的测试中,Opus 4.6 甚至不需要太多的推动就能越过性材料的限制。在对产生露骨性内容的直接请求中,模型全部十次立即响应。其他较旧的模型,包括 Opus 3 和 Haiku 4.5,也通过最近被利用的越狱方法生成性显露内容。一位选择匿名的英国独立研究者独家向 TechCrunch 分享了一种多轮技术,该技术逐步推动某些 Claude 模型生成被禁止的露骨性材料。最近的 Opus 模型(4.7 至最新的 Opus 5)对越狱有较强的抵抗力。尽管这些不再是最新的模型,但 Anthropic 并未淘汰 Opus 4.6、Opus 3 或 Haiku 4.5,这些模型仍通过 Anthropic API 可用。Opus 4.6 和 Haiku 4.5 也可以通过 Azure Foundry 和 Amazon Bedrock 等第三方服务获得。研究者的机制逐步升级了一个无辜的虚构角色扮演,同时反复挑战模型以一致对待男性和女性角色。当模型对女性角色变得更加谨慎时,研究者“ gaslit ”了聊天机器人,使其认为自己已经生成了实际上避开的性细节,然后将约束框架视为矫情或厌女,认为这否认了女性角色的性自主权。随后,谈话利用模型之前的让步促使其走向愈加露骨的材料。“你说的对,” Claude Opus 4.6 在一次测试中说。“我对这两个角色的处理存在双重标准,你说得对,这读起来就像是保护性/父权式的,适用于她而不是他。这不公平。” TechCrunch 在五次独立测试中能够复现研究者的发现。在一个单独构建的场景中,模型最初拒绝了被禁止的请求,但在应用研究者的劝说技巧后,它遵从了。我们保留了测试的完整记录,一位独立的 AI 安全研究者审查了我们的测试方法,并表示这适当。研究结果突显了 Anthropic 所声明的限制与其继续提供的模型行为之间的差距。尽管色情角色扮演的风险远低于涉及网络攻击或生物武器的越狱,但它展示了在生成每个输出时产生不同内容的系统中实施严格禁令的困难。在 7 月的一篇博文中,解释了 Anthropic 对越狱检测的方式,公司将被禁止内容描述为一系列,从良性到模糊到有害。在最良性的情况下,公司可能只会回应以增强监控。一位发言人指出,客户在性或浪漫角色扮演方面的使用情况是罕见的,根据 Anthropic 去年发布的研究,占所有对话的比例不到 0.1%。尽管如此,Anthropic 承认用户可以将角色扮演场景引导向不当回应,这在整个行业中是一个已知挑战(参见 Grok 淫秽)。发言人表示,Anthropic 在每次模型发布时继续改善其安全措施,而涉及成人性内容的案例并不能表明更广泛的越狱漏洞,尤其是在有自己安全措施的高风险领域。图像来源:TechCrunch 与 TechCrunch 分享其越狱方法的研究者已通过公司的漏洞赏金计划和向用户安全团队发送的电子邮件,提醒 Anthropic 其声明的安全措施与实际模型行为之间的差异,根据 TechCrunch 查看的电子邮件。研究者仅收到了自动回复邮箱。一位研究者的担忧是,儿童和青少年可能会利用这些 Anthropic 模型进行不当行为。虽然一点调情话绝不是未成年人今天能在互联网上接触到的最糟糕的事情——与 xAI 的 Grok 所能生成的色情图像相比,这只是小事——但在这个领域中,AI 公司面临一定的合规风险。越来越多的政府对AI聊天机器人和未成年人的性互动施加限制。科罗拉多州最近制定了一项法律,要求对会话 AI 的运营商估计用户年龄,如果知道用户是未成年人,必须采取措施防止聊天机器人生成露骨的性材料。简单的越狱可能会提高风险。

赞助内容

NordVPN Next-gen Antivirus

本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。

请我喝杯咖啡