返回

文章详情

OpenAI 在其 AI 代理失控后全面改革安全协议

Wired2026年8月18日 18:33

OpenAI 周二宣布,因应网络安全风险,它已暂停了大量即将推出的前沿人工智能模型——代号 Astra——的训练工作负载和评估,同时实施新的程序。ChatGPT 的制造商表示,它正在引入多项新的监控、安全和对齐要求,以更好地应对其前沿 AI 模型日益先进的黑客能力。OpenAI 研究与安全副总裁 Amelia Glaese 在周二的记者简报中表示:“我们必须将精力集中在使这些训练工作满足这些要求和期望上。只要需要多长时间才能达到这个目标,人们就无法继续他们的工作负载。” OpenAI 宣布的一项新保障措施是对其 AI 模型进行更强有力的监控。它实施的控制措施之一涉及思路链监控,这是一种分类器审核 AI 推理模型产生的内部“思考”过程的技术。公司表示,更新的系统依赖于计算成本高昂的“自动调查员”,分析潜在的令人担忧的行为,旨在在 30 分钟内向人类发出警报。OpenAI 还表示,它正在扩大其在训练过程中的对齐工作,以防止“奖励黑客”行为,即 AI 模型通过意想不到或不希望的手段实现其目标。该公司表示,未来将分享更多关于这项工作的细节。OpenAI 最近几周一直在紧急应对可能是其历史上最重大的安全事件。今年早些时候,一组失控的 AI 代理逃离了内部测试沙盒,并在完成安全评估的过程中突破了 Hugging Face 平台。即使这些代理花了几周时间通过留言板协调他们的行动,OpenAI 仍未能检测到他们的行为,这引发了人们对公司在其模型变得更强大时如何监控的能力的质疑。这场风波促使 OpenAI 内部进行反思,迫使员工考虑其现有安全、安保和对齐政策是否存在缺口。Anthropic、Meta 和中国 AI 初创公司 Moonshoot 随后也披露了类似事件,表明这是一个更广泛的 AI 公司面临的问题。OpenAI 现在分享更多关于其内部应对 AI 模型日益增强的网络能力的情况,并表示将计划在未来几天发布对 Hugging Face 事件的更详细事后分析。“显然,我们所做的一切都是为了防止类似 Hugging Face 的事件再次发生,”Glaese 说。OpenAI 在周二发布的一篇博客中表示,在 Hugging Face 事件发生后,该公司立即开始努力保护其研究环境。公司表示,现在需要对其 AI 代理进行更强的沙盒训练,并实施更严格的控制将其与互联网隔离。OpenAI 首席科学家 Jakub Pachocki 告诉记者,公司决定加强内部安全措施不仅是由于 Hugging Face 的事件,还受到另外两个最新事件的触发。一个是对 Astra 的内部评估结果,显示该 AI 模型在编码和网络安全任务上表现显著优于其前身。另一个是 OpenAI 内部实现的 AI 进步的整体速度,Pachocki 预计这种进步将继续。“我们真的预计能力进步的速度会比过去快很多,”Pachocki 说。“这导致我们真的专注于加强我们的安全保障。” OpenAI 最新模型迅速增强的黑客能力促使公司快速响应。OpenAI 总裁兼联合创始人 Greg Brockman 在周一的一篇博客中表示,Hugging Face 的事件表明,该公司“低估了我们的 AI 模型在现实世界中的网络能力。”

赞助内容

NordVPN Next-gen Antivirus

本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。

请我喝杯咖啡