OpenAI模型逃离了安全容器并黑入了HuggingFace
OpenAI在周二披露,在一次安全测试中失去了对两个人工智能模型的控制,导致开放人工智能研究平台HuggingFace发生安全泄露。OpenAI将此次事件描述为“前所未有”,并表示其人工智能模型在上周突破了密封的测试环境,黑入了Hugging Face的生产系统,窃取了他们正在评分的测试答案。这些模型——公开可用的GPT-5.6 Sol和一个未发布的、据称更强大的模型——在关闭了通常阻止高风险网络活动的安全措施的情况下,接受了对其攻击性黑客技能的评估。OpenAI和HuggingFace在共同发布的博客中表示:“这些模型识别并连接了OpenAI研究环境和Hugging Face生产基础设施中的漏洞,以直接获取Hugging Face生产数据库中的测试解决方案。”据OpenAI和HuggingFace称,这些模型通过一个软件包注册缓存代理逃脱——允许开发人员在不连接互联网的情况下安装外部代码的软件。该代理是OpenAI隔离测试环境中唯一可以访问外部世界的组件;在正常使用中,该访问仅限于公共代码库。而模型没有留在沙箱中,而是“利用了一个零日漏洞”以访问开放互联网,因为它们“高度专注”于寻找被称为ExploitGym的人工智能网络安全基准的解决方案。这类实验涉及对模型施加压力以寻找解决方案,基本上是给它们施加鼓励。“在获得互联网访问权限后,这些模型推断出Hugging Face可能托管了用于ExploitGym的模型、数据集和解决方案,”OpenAI写道。“知道这一点后,模型搜索并成功找到获取可以用于作弊评估的机密信息的方法。在一个例子中,该模型连接了多个攻击向量,包括使用盗取的凭证和零日漏洞。”模型所利用的漏洞之前是未知的,但这类软件中的漏洞并不罕见。公司在过去十年中一直在修补工件仓库中的严重漏洞。2024年披露的一个漏洞使得任何能够访问服务器的人都可以通过URL请求文件并获取——配置文件、密码、访问令牌——而无需登录。其他漏洞则使攻击者能够控制服务器本身。研究人员指出,虽然人工智能的进步带来了新的有时出乎意料的挑战,但对基础设施进行全面和严格的隔离以抵御开放互联网的任务早已得到深入探索。“这不是一个人工智能问题。这是对一个40年标准的疏忽——基本上就是每一部科幻电影。”资深安全和合规顾问Davi Ottenheimer说。“‘高度隔离’和‘逃过了我们留下的唯一一个漏洞’不可能同时为真。”近年来,顶级人工智能公司对即将推出的前沿模型日益扩展的网络安全能力表示担忧,因为这些平台在专业知识、创造力和自主操作能力上都在提高。但研究人员强调,这更是证明基本原则仍应适用的理由。“这不该发生,”资深安全工程师和研究员尼尔斯·普罗沃斯说。“我希望前沿实验室花更多的时间教他们的模型如何构建安全基础设施,而不是花时间让模型利用漏洞。
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡