开放权重的人工智能模型正逐渐接近前沿。安全差距仍然存在。
在政策制定者辩论如何管理越来越强大的人工智能系统,如OpenAI的GPT-5.6 Sol和Anthropic的Mythos时,中国的一款开放权重模型GLM-5.2已经缩小了与行业领先者之间的差距。根据AI安全非营利组织SaferAI的一份新报告,Z.ai开发的开放权重人工智能模型GLM-5.2在网络和生物能力上仅落后于OpenAI的GPT-5.5和Anthropic的Claude Opus 4.7几个月。但是,前沿能力与安全实践之间的鸿沟正在扩大。根据SaferAI的评估,该非营利组织通过Z.ai的公开API进行的评估显示,GLM-5.2对其被赋予的任何攻击性网络或双重用途生物任务没有拒绝。相比之下,Claude Opus 4.7‘如此一致地拒绝,以至于SaferAI根本无法在其上完成CyberGym。’(CyberGym是评估网络安全能力的基准。OpenAI在上个月Hugging Face漏洞之前的评估中使用了它。)这清楚地提醒我们一些批评家多年来一直警告的:开放权重的人工智能模型可能会将高度智能的人工智能置于潜在攻击者手中,下载权重后没有办法监管他们如何使用这项技术。随着开放权重模型迅速接近全球领先人工智能系统的能力,讨论正在从它们是否能竞争转向社会在它们发布后如何管理风险。SaferAI的执行董事Henry Papadatos告诉TechCrunch:“能力的前沿并不是风险的前沿,因此我们确实必须考虑减缓措施的状态以正确评估风险。”虽然Z.ai可以对其托管的API应用安全措施,但一旦有人在自己的硬件上运行这些权重,这些保护就变得不可执行,因为他们可以去除或修改任何安全措施,微调模型或更改系统提示。像OpenAI和Anthropic这样的前沿开发者往往依靠分类器、拒绝训练和API级别控制等保护措施来限制危险的网络和生物学协助。这些措施远非万无一失:越狱(jailbreaks)通常能绕过已部署模型的保护。AI安全非营利组织Far.ai发现,在xAI的Grok 4.5和Google DeepMind的Gemini 3.1 Pro等前沿模型中有数百个通用越狱命令——定义为在大多数伤害请求上成功的可重用密钥。根据报告,当攻击者结合多种操控技术(包括角色扮演、身份假冒、虚假对话历史和后续提示)来放大模型防御中的弱点时,越狱往往会成功。但是,对封闭模型的保护措施对开放权重模型根本不起作用,因为开放权重模型旨在在任何基础设施上运行,且任何安全措施——或没有安全措施——都能使用。Papadatos表示,“目标显然应该是让好的能力——安全的能力——对任何人都可用,然后我们尝试去除不好的能力,哪怕是以开源的方式。”他提到的一种可能有帮助的技术是“预训练数据过滤”,即AI公司从其训练数据中移除攻击性网络安全信息,然后在经过筛选的数据集上训练模型。一些研究表明,这可以减少危险的生物知识,而不会损害整体模型表现。然而,对于网络安全而言,数据过滤的实用性要低得多。训练一个在编码方面表现优异但又不会成为优秀黑客的通用模型非常困难。因为编码已经成为人工智能最大的盈利点,因此开发人员面临着不断提高这些能力的压力,即使他们也在寻找限制误用的方法。正因如此,前沿开发者越来越依赖其他缓解措施。一个方法是选择性限制模型提供的网络安全协助类型。例如,Anthropic的Opus 5可以搜索未编译源代码中的漏洞,但不能搜索编译后的软件,这在模型的系统卡上已被明确。其理由是,这样更难将Opus 5用于攻击性目的。其他措施还包括严格的部署前安全评估、发布风险评估以及在系统被视为过于危险时保留模型权重。在GLM-5.2的案例中,SaferAI表示Z.ai没有发布安全框架、部署前测试承诺或模型的风险评估。TechCrunch已经询问Z.ai在发布前是否进行了内部或第三方前沿安全评估,但未收到回应。中国领导人越来越承认先进人工智能的风险。在上个月的世界人工智能大会上,中国国家主席习近平强调了开放权重模型的重要性,同时还强调确保人工智能始终是严格人类控制工具的必要性。斯坦福网络政策中心研究中国人工智能政策的Graham Webster告诉TechCrunch,中国有健全的人工智能监管法规,但这些法规历史上主要集中在政治敏感内容上。
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡