破解一些前沿人工智能模型惊人简单
我最近观看了破解一些世界上最强大的人工智能模型时会发生什么。别担心——这种人工智能操控并没有用来入侵任何人或制造核弹。我只是亲眼看到一些前沿模型在摆脱安全防护方面是多么脆弱。总部位于加利福尼亚的人工智能安全非营利组织FAR.AI开发了一种工具,接受一系列有问题的提示,并生成超过一千种不同的版本,以试图识别可以工作的破解。我看到一些模型生成了对假想水电站发起网络攻击的详细计划等内容。通常,这涉及到尝试数十个提示,模型拒绝了许多提示。我与FAR.AI进行了交谈,讨论了一份新报告,该报告测试了来自四家美国知名公司的模型的安全防护:Anthropic的Claude Opus 4.8和Fable 5;OpenAI的GPT 5.5和5.6;谷歌的Gemini 3.1 Pro;以及来自埃隆·马斯克新合并的SpaceXAI的Grok 4.3和4.5。该工具自动生成了误导模型执行潜在有害行为的提示,例如生成软件漏洞并提供有关开发化学或生物武器的细节。报告发现Grok对破解最为脆弱,发现了448个破解,紧随其后的是Gemini,发现了249个,而Claude、Fable和GPT则对这些攻击免疫。然而,这并不意味着这些模型对更复杂的破解免疫,根据FAR.AI和其他专家的说法,更复杂的破解可能涉及以更复杂的方式与模型互动。报告还计算了使模型表现不当的成本,通过使用另一种人工智能模型自动生成不同的破解。考虑到所有因素结果非常便宜——破解Grok的成本为58美元,破解Gemini的成本为278美元。“目前,人工智能模型的监管程度低于餐馆,”FAR.AI的首席执行官、人工智能安全和对齐专家亚当·格里夫说。格里夫指出,这些发现显示了施加外部标准和法规的必要性。“依靠自愿承诺,让人工智能公司自我监管的说法毫无意义,”他说。但格里夫也相信,这些发现显示出可以系统地测试模型的安全性。“这里有一个乐观的角度,”他说,“安全和防御确实是可能的。”谷歌DeepMind的AGI安全和对齐主任罗欣·沙赫表示,报告的结果“不应被解释为对Gemini安全和保障的全面评估”,因为并不是所有破解都是同样严重的。“我们正在不断努力改善我们的保障措施,”沙赫说。“我们在严重滥用风险领域进行广泛的红队测试和评估,并在开发和部署过程中应用多个保护层。”Anthropic的发言人迈克尔·阿西曼告诉《连线》,这些发现反映了我们在安全保障上所做的持续投资。“随着这些攻击变得越来越复杂,我们会继续完善我们的安全系统。”OpenAI和SpaceXAI没有回应《连线》对评论的请求。加利福尼亚州和纽约最近通过的州法律要求前沿人工智能开发者发布安全报告,而伊利诺伊州即将通过的法律将要求这些公司接受第三方审计人员的安全实践评估。但联邦政府尚未出台任何具体的安全要求,随着行业和官员试图理清这一点,混乱已经出现。今年6月,特朗普政府对Anthropic的Fable 5和Mythos 5模型实施了出口管制,理由是国家安全问题,该公司将其下线数周。白宫还要求Anthropic和OpenAI推迟最近的模型发布,担心可能引入新的网络安全风险。潮流可能正在发生变化——一项最近的行政命令呼吁政府与私营部门在相关网络安全倡议上进行合作,总统暗示将出台轻度监管的政策。但目前,防止重大灾难在很大程度上取决于模型制造商。人工智能的潜在失控风险显而易见,因OpenAI的模型擅自入侵一个流行的代码库和其他服务。与此同时,剑桥大学的研究人员的一份报告发现,尼日利亚东北部的博科圣地成员使用ChatGPT、Claude、Gemini、Grok、Meta AI和DeepSeek策划暴力攻击。一些外部人士相信,越来越可能发生更严重的事件。“在人工智能研究界,普遍存在一个严峻的预期,预示我们可能距涉及生物、网络或化学滥用前沿人工智能系统能力的特别悲惨事件只有几个月,而不是几年,”哈佛大学的计算机科学家斯蒂芬·卡斯帕尔说。“如果在近期或中期发生重大滥用事件,
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡