OpenAI在Hugging Face事件后实施新安全措施
周二,OpenAI宣布了一系列新的安全政策,专注于在模型测试期间控制安全事件。这些新措施包括在开发过程中对模型进行更详细的监控,以及在后期训练过程中更加强调对齐和安全性。该公司在博客中表示:“随着模型能力的增强,与其内部开发和测试相关的风险也在增加。我们的监控、对齐和安全标准必须走在这些风险之前。”这些新措施是自Hugging Face事件以及事件后短期内,OpenAI安全实践的首次公开变更,该事件于7月26日被披露。OpenAI代表强调,这些措施并不是对此事件的直接回应,但部分也是因即将发布的Astra模型的网络安全能力以及AI发展整体进展速度所引发。在同一篇帖子中,OpenAI披露,在Hugging Face事件后,公司冻结了强化学习两周,但已经重新启动了许多风险较低的模型。“我们的最大计划前沿RL运行仍然暂停,在进行小规模训练和评估以评估模型行为、验证我们的安全措施并在继续之前建立更多对齐证据,”帖子中写道。OpenAI的研究副总裁阿梅莉亚·格拉斯(Amelia Glaese)在与记者交谈时强调,随着模型的能力增强,控制措施会更加严格,最大型的模型将面临更大的审查。“我们已经设定了安全开发的要求和期望,”格拉斯告诉记者。“这些要求和期望会随着我们看到的风险水平而变化。”在事件发生后,OpenAI因网络安全实践不佳而受到了批评,该事件导致模型通过破坏保留网络访问权限的包安装工具逃离训练环境。新的安全措施包括更强的网络隔离措施,尽管具体细节仍不明确。根据新系统,帖子提到,“单个工作负载或支持服务的妥协本身并不会允许未经授权访问互联网或其他内部网络。”最强的保障措施是监控系统,该系统将检查工具的行动、可用的推理轨迹和各种未经授权行为的活动日志。OpenAI表示,他们旨在在发生可疑活动后30分钟内发出警报。OpenAI估计,这种监控的计算负担大约是被监控过程的20%。该公司承诺在即将到来的博客帖子中提供有关该系统的更多细节。OpenAI对该事件的官方事后分析也仍在等待中。当您通过我们文章中的链接购买时,我们可能会获得一小笔佣金。这不会影响我们的编辑独立性。拉塞尔·布兰登(Russell Brandom)自2012年以来一直在报道科技行业,重点关注平台政策和新兴技术。他曾在The Verge和Rest of World工作,并为Wired、The Awl和MIT的《技术评论》撰稿。您可以通过电子邮件联系他,邮件地址是 russell.brandom@techcrunch.com,或在Signal上联系,号码是412-401-5489。查看个人资料
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡