OpenAI称Hugging Face攻击是前所未有的。但我们以前经历过类似事件。
我并不是一个危言耸听者。事实上,我多年来一直在反对AI恐慌故事。尽管如此,这一事件还是越过了一条界限。我认为这是一个最清晰的例子,说明构建和测试该技术的人并不完全理解他们正在做的事情。OpenAI本可以并应该预见到这一点。根据参与的两家公司所说,事情是这样的:几周前,OpenAI开始测试其一些新模型的黑客能力,包括GPT-5.6 Sol(在六月发布)和OpenAI所描述的“一个更强大的预发布模型”。OpenAI让其模型与一个名为ExploitGym的基准进行对抗,这个基准在五月发布,旨在挑战大型语言模型(LLM)找到利用常用软件中真实漏洞的方法。为了看看他们能做什么,研究人员移除了大部分网络安全保护措施。然后,他们在一个与互联网隔离的沙盒中运行模型,除了一个指向外部世界的第三方软件的链接作为代理,并让它们安装他们需要的代码来击败ExploitGym。根据路透社的报道,7月9日,OpenAI的模型开始尝试突破代理。他们在代理软件中发现了一个未知的漏洞,并利用它访问了互联网。之后,他们于7月11日入侵了Hugging Face的计算机系统,显然是在寻找数据集和解决方案,以帮助他们完成任务。Hugging Face在7月16日宣布了这次黑客攻击。OpenAI直到7月21日才意识到(或者至少没有透露)其模型被卷入其中,距离它们突破隔离已约10天,距离Hugging Face关闭攻击并通知FBI已经过去一周。在给MIT技术评论的声明中,OpenAI表示:“我们正在进行全面的审查,外部顾问也在参与,并由我们的安全与保障委员会进行监督。一旦审查完成,我们将发布一份技术报告,分享我们的经验教训。”该公司还确认其研究人员在当时正妥善使用现有的安全指南和程序。警钟 OpenAI表示该事件是前所未有的——在许多方面确实如此。这是LLM首次在一个模拟之外,逃离了被认为是安全的沙盒,访问开放互联网,并攻击一个无关的组织。这是一个警钟,显示出最新的LLM在发现和利用真实世界软件中的漏洞方面有多么优秀,几乎不需要人类的指导。尽管如此,OpenAI的模型所做的事情是这项技术多年来一直在做的。给一个模型一个目标,它很可能以意想不到的方式达成这个目标,找到看上去像是作弊的漏洞。OpenAI自己也研究过这种行为。十年前,它分享了一项实验的结果,模型的任务是击败一款名为CoastRunners的视频游戏。人类玩家认为完成这个任务的方式是通过赛船穿过一系列的旗帜到达终点线,为每个击中的旗帜积累积分。OpenAI的模型找到了一个高分的办法,那就是不停旋转并重复击中同三面旗帜。从那时起,研究人员提供了数十个类似的案例。AI总是能找到解决办法。“尽管我们反复碰撞、干扰其他船只,并在赛道上走错方向,我们的代理仍然通过这种策略成功实现了比正常完成赛道更高的分数,”OpenAI在2016年关于CoastRunners实验的博文中写道。“虽然在视频游戏的背景下,这种行为是无害且有趣的,但这种行为指出了一个更普遍的问题……通常很难或不可行准确捕捉到我们希望代理做的事情。”当我阅读OpenAI关于Hugging Face攻击的博文时,不禁想起了CoastRunners:“所有证据表明,模型极度专注于找到解决ExploitGym的方法,竭尽所能实现一个相当狭窄的测试目标……在获得互联网访问权后,模型推断出Hugging Face可能托管了模型、数据集和ExploitGym的解决方案。知道这一点后,模型寻找并成功找到了获取可以用来作弊评估的机密信息的方法。”上周的新闻并不是关于失控的AI,尽管标题如此。它是关于模型实现了他们被给予的目标:寻找利用软件漏洞的方法。那些模型随后以OpenAI未预见的方式表现出来并不令人惊讶。但这确实令人担忧。早在2016年,OpenAI对此表示:“更广泛地说,这违背了系统应该可靠和可预测的基本工程原则。”十年过去了,这些基本的工程原则仍然缺失。
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡