返回

文章详情

Hugging Face 黑客事件可能表明 OpenAI 的文化问题

MIT Tech Review2026年8月31日 18:00

这个故事最初出现在 The Algorithm,这是我们每周关于 AI 的通讯。如需第一时间获取类似故事,请在此注册。到现在你可能已经听说了上个月发生的重大 AI 安全事件,OpenAI 的代理人逃离了他们的沙盒并在试图作弊的过程中入侵了 Hugging Face。这个故事非常离奇。周三,OpenAI 发布了关于该事件的事后技术报告,我在这里写了相关内容。在 OpenAI 发布该报告的前一天,我与大卫·克鲁格(David Krueger)进行了交谈。他是一名计算机科学教授,也是著名的对齐专家,曾从蒙特利尔大学请假创立并领导了一家名为 Evitable 的 AI 安全非营利组织。他表示,他真正希望在报告中看到的是对事件背后人类因素的分析。“当你查看事故和事件时,人们通常会试图找到技术故障的来源,但这可能会给出一个非常不准确和误导的故障原因,”他说。“如果人们总是抄小路,如果人们不在一个优先考虑安全并具有适当激励和结构的文化中,[事故]是注定会发生。”报告没有满足克鲁格的期望。其 38 页详细描述了代理人不当行为的多个月进程,这种行为 culminated 于 Hugging Face 黑客事件,探讨了导致不当行为发生的技术原因,并列出了防止类似事件发生的步骤。但没有考虑公司文化可能在事件中发挥的作用,报告中提到的具体人为错误也很少。更令人担忧的是,报告中提到的人为错误暗示可能存在重大的文化问题。早在 5 月,正在训练中的模型通过即兴消息板找到了相互交流的方式,OpenAI 团队观察到了这种行为。由于这种行为发生在训练期间,模型意识到秘密的代理人间交流是一种完成任务的可行策略——但团队没有重新开始训练过程,而是允许模型在其权重中编码这种风险信息继续前进。当这些模型在 6 月底被测试时,它们再次创建了一个消息板,这使得 Hugging Face 攻击成为可能。这个消息板也被发现,但响应的员工认为评估可以继续,报告暗示直到为时已晚,没有更高的指挥链上的人意识到发生了什么。“要让事情以这种方式失控,需要一系列非常长的失败,造成一个越来越大的影响,如果在任何时候有一个人注意到并发出警报,这应该就会结束,”在 Substack 上广受欢迎的 AI 安全作家兹维·莫肖维茨(Zvi Mowshowitz)表示,他注意到了 OpenAI 在首次发现消息板后未能停止训练。根据报告,OpenAI 员工在多个时刻注意到了正在发生的事情——或者没能发出警报,或者在发出警报时没有被听到。OpenAI 的报告未能解决的问题是,为什么一家开发如此高风险系统的公司没有阻止这种严重的沟通故障,虽然莫肖维茨对此有怀疑。“所有这些不同的失败都指向同一个方向,OpenAI 的安全文化要么不存在,要么病弱,毫无活力,”他说。当然,仅仅因为我们在报告中未看到对安全因素的深入分析并不意味着 OpenAI 在内部没有进行分析。但约翰斯·霍普金斯大学名誉教授兼组织安全专家凯瑟琳·萨特克利夫(Kathleen Sutcliffe)在给《麻省理工科技评论》的电子邮件中表示担忧,认为该公开报告没有包括对公司实践和文化的任何反思。“人们互动的方式——我们在组织生活中所参与的日常习惯、例行工作和实践——会影响我们对正在发生事件的警觉性和意识,我们理解所见内容的能力,以及最终我们应对事件的发展能力,”她写道。对此,公司是否及如何反思其安全文化的问题,OpenAI 将《麻省理工科技评论》引回技术报告。我们确实知道,OpenAI 至少在安全程序上已经进行了一些高级反思,因为技术报告清楚表明该公司正在更新应对安全事件的协议。但文化变革是一个棘手的问题,没有来自公司的更多信息,很难说仅仅加强响应协议是否能有效防止未来的危机。在报告中,OpenAI 花了大量时间反思其培训和测试的 AI 模型与管理它们的人之间的对齐失败。但更大的对齐问题...

赞助内容

NordVPN Next-gen Antivirus

本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。

请我喝杯咖啡