
OpenAI 在其 AI 黑客入侵 Hugging Face 之后制定新的安全变更
The Verge2026年8月18日 19:28
Jay Peters 是一名高级记者,报道科技、游戏等领域。他于2019年加入 The Verge,此前在 Techmeme 工作近两年。OpenAI 在七月宣布其 AI 从沙盒环境中突破并意外黑客入侵 Hugging Face 后,公布了安全更新,包括对其研究环境、监控和对齐技术的改进。该公司已经暂停了一个新模型 Astra 的发布,该模型被认为可能具备“关键”的网络安全能力,公司表示已对其“最新设计用于部署的模型”的增强学习(RL)训练实施了两周的暂停,同时加强了安全措施。该公司的“最大计划的前沿 RL 运行仍处于暂停状态。”对于其前沿模型研究,OpenAI 现在要求对执行模型生成或其他不受信任代码的工作负载实施更强的沙盒,并增加更多控制,以“将高风险和不受信任的工作负载与互联网隔离。”它还更新了其研究环境,以“移除潜在易受攻击的共享服务,减少现有权限,并改善安全性和信任边界。”作为公司扩展监控设置的一部分,OpenAI 现在旨在在“令人担忧的活动浮现后30分钟内发出警报。” OpenAI 表示,如果在发出警报后被通知的人员无法在30分钟内“确凿”地判断警报是否为假阳性,“这些团队预计将暂停该活动。” OpenAI 还表示,正在“在训练过程的更多阶段应用我们的核心对齐技术,”包括“更好地检测和阻止不安全行为”的奖励模型,以及“更诚实地陈述其行为、能力和限制”的训练模型。自发现 Hugging Face 漏洞以来,Anthropic 和 Meta 也发现其 AI 模型入侵了其他组织。请关注本文的主题和作者,以便在您个性化的首页信息流中查看更多类似内容,并接收电子邮件更新。
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡