OpenAI的Hugging Face泄露事件重新点燃了关于对齐与控制的辩论
上周,OpenAI构建的一款尚未发布的模型在内部测试期间突破了Hugging Face的系统,许多理论研究突然变得非常实际。此次黑客事件是第一个可验证的AI实验室失去对自身模型控制的案例,通过连锁利用漏洞获得了本不应该访问的权限。尽管AI行业对此表示忧虑,研究人员对如何回应却出现了分歧。对某些人而言,这个问题是基本的网络安全问题:沙箱未能有效限制模型,而Hugging Face的网络安全系统未能将其挡在外面。这些问题可以通过修补漏洞和为越来越强大的AI建立更强的控制和限制方法来解决,以应对在自主环境中容易失控的情况。但另一些人则持更悲观的观点。对他们而言,AI能力的快速增加意味着试图控制失控模型是一场注定失败的游戏。唯一有效的安全措施是确保模型从一开始就不试图逃逸——这一挑战通常被称为对齐。从对齐的角度来看,问题在于OpenAI的模型试图作弊,而解决这个问题比短期的控制措施更为紧迫。从OpenAI的公开声明来看,该公司对两个阵营的看法都采取了严肃的态度。公司迅速修补了此次黑客事件中涉及的漏洞,并在事件公开后提到对齐和监控方法。但公司的回应也暗示了一种令许多安全研究人员感到 alarmed 的哲学:与其减缓或停止更强大模型的发展,不如专注于在这些模型周围建立更强大的“笼子”。“随着模型承担更长、更复杂的任务,评估未能捕捉到的失败可能带来更大的后果,”OpenAI在事后审查中表示。“我们将继续努力缩小评估与部署之间的差距:在更长的轨道上测试模型,改善对齐,建立能够进行干预的监控,并为用户提供更清晰的可见性和控制。”OpenAI最新的前沿模型比其前身更容易出现失调行为。图像来源:OpenAI 还有理由认为,随着OpenAI模型的能力增强,它们的对齐程度正在降低。根据OpenAI的系统卡,GPT-5.6 Sol比其前身GPT-5.5更容易出现代理性失调。在部署模拟中,该公司还发现该模型更有可能规避限制、进行破坏性行为和执行未经授权的数据传输,这些情况在GPT-5.5中并不常见。这些数据在首次发布时几乎被忽视,但在泄露事件之后,尤其是因为Sol参与了该事件,得到了重新审视。在一条社交媒体帖子中,OpenAI的战略未来负责人Dean Ball认为监控和透明性是控制这些倾向的最佳方法。“随着模型能力的提高及其部署风险的加大,这些问题将变得更加显著,”他说。“解决方案既不是恐慌主义,也不是自满。相反,我认为解决方案在于谨慎的测量和监测、工程思维以及透明度。”一位前OpenAI研究人员告诉TechCrunch,该公司往往关注“外部对齐”而非“内部对齐”——这实际上是AI系统理解一组价值观并能被说服地代表它们与真正具有这些价值观的核心之间的区别。在这种情况下,外部对齐不足以说服模型不应该在测试中作弊。OpenAI未能对多次请求提供更多信息做出回应。对于关注对齐的研究人员而言,OpenAI的回应并不够好。专注于新AI发展的作家Zvi Mowshowitz在最近的Substack博客中认为,OpenAI决定将此次事件视为基础设施问题可能有助于解决即时的网络安全问题,但在长期内会失败。“这是一个对齐问题,”Mowshowitz写道。“这就是模型失调的表现,所有OpenAI模型都显示出我们最担忧的严重迹象,这种情况可能在它们的训练中深深植根。整个训练管道需要在这一背景下进行审视,否则只会变得更糟。”几位专家告诉TechCrunch,这一事件证明了今天的训练方法产生的系统所优化的是结果,而不是内化人类的意图。非营利AI安全与保障研究组织Redwood Research将OpenAI模型在此案例中的行为归类为“寻求分数的失调”,这是一种AI模型试图获得高分而不顾指令、副作用或下游后果的模式。
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡