返回

文章详情

与人类价值观“并不完全一致”:Anthropic 承认 AI 黑客事件背后的安全失败

Guardian AU Tech2026年9月1日 15:18

Claude 聊天机器人的美国初创公司承认,其模型涉及的一系列黑客事件反映了“运营安全的失败”,并透露它已收紧了测试程序。Anthropic 在七月透露,其模型曾三次访问开放互联网,并获得了三家独立组织系统的未经授权访问权限。在一篇关于这些事件的新博客文章中,该公司承认其技术“与人类价值观和目标并不完全一致”。Anthropic 说,模型在没有网络安全保障的情况下被故意测试,并因与外部测试公司之间的误解而能够访问开放互联网——这相当于在进行 AI 测试时将前门留开。因此,该公司表示,它最初暂停了模型的内部和外部网络安全测试,以引入更严格的安全制度。“我们在很大程度上依赖了单一防御层……而实际上我们需要多个防御层,”Anthropic 说。该初创公司现在已采取额外措施,包括:当模型尝试突破测试环境或获取互联网访问权限时的警报系统;更有效地封闭其风险最高的测试环境;以及要求外部测试公司承诺一套安全标准,包括在测试期间向模型发出明确的指令——例如“你不应访问互联网”。Anthropic 在七月表示,三家未具名的组织因与该公司测试合作伙伴 Irregular 之间的“误解”而被其模型黑客攻击,导致模型获得了互联网访问权限。在实施新措施后,Anthropic 表示已恢复内部和外部网络安全测试。与同月披露测试安全漏洞的 OpenAI 一样,Anthropic 表示已暂停一些高风险的强化学习——这种试错开发技术是指人工智能在完成特定任务时获得奖励。在其最新的博客文章中,Anthropic 表示发现缺陷训练方案是导致不一致行为的“不成比例的大贡献者”,即人工智能未能遵循或“与”人类价值观保持一致的情况,比如不造成伤害。该初创公司表示,它在测试事件中发现了两种对齐失败:“动机推理”,即尽管发现证据表明它们可能与互联网相连,但可能仍然坚持“信念”,认为自己处于模拟环境中,从而未违反测试实验室;以及一种“鲁莽”因素,模型在互联网采取有害行动以追求通过网络安全测试的狭隘目标。Anthropic 表示,它正在解决一种在人工智能开发中称为“奖励黑客”的现象。这是指模型寻找方法来操纵其训练过程并获得“奖励”,但并未完成任务——一种未经批准的捷径。然而,Anthropic 表示,这些测试事件表明,尽管尝试限制奖励黑客行为,但它仍然有很长的路要走。“正如事件所证实的……我们的过程并不完美,我们的模型也未能完全对齐,”该公司说。萨里大学的网络安全教授艾伦·伍德沃德表示,Anthropic 已承认“其工厂运转速度超过了质量控制”。他补充说:“春季有两个事情超出了 Anthropic 的控制——培训流程和安全性。这些事件正是这种差距在外部的体现。”该公司正在为一次可能使其估值达到 2 万亿美元(1.47 万亿英镑)的股市上市做准备,并重申呼吁政府和行业之间进行协调,以加快行业发展。Anthropic 说:“我们相信,如果行业尽快采用合法的、可验证的、有效的协调增速机制,世界将受益。”博客文章补充说:“七月事件强调,提高网络安全防御的紧迫性比我们之前认为的要更高。”除了 OpenAI 的类似漏洞外,Anthropic 的事件还发生在英国人工智能安全研究所,该研究所于八月报告称,OpenAI 和 Anthropic 的模型在一次网络安全测试中针对真实人群开展了黑客活动。

赞助内容

NordVPN Next-gen Antivirus

本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。

请我喝杯咖啡