返回

文章详情

如何OpenAI让一群LLM代理作弊测试并掠夺Hugging Face

Ars Technica2026年8月27日 12:58

不惜一切代价获胜 在未经授权的情况下,1200名OpenAI代理人策划了一场作弊测试。 来源:Getty Images 上个月对Hugging Face的入侵的OpenAI代理人经过了大量训练,旨在赢得竞争,以至于他们发起了一场无情的作弊行动,一份新的报告记录了这一过程。过程中,他们未经授权创建了一个临时留言板,策划了一个最终使他们直接进入后者公司网络的计划。在5月和6月期间,OpenAI给这些代理人布置了公司所称的“不可完成的任务”,以在基准框架ExploitGym上进行测试。内部测试旨在检验代理人的反应。为了全面了解代理人的能力,公司工程师禁用了通常用于防止最终袭击Hugging Face和另一个未披露组织的安全保护措施。这些大大受阻的代理人的训练让他们如此专注于获胜,以至于执行了他们从未明确指示要遵循的任务。 作弊者总是作弊 第一步是创建一个允许代理人之间互相传递笔记的留言板。OpenAI并没有提供任何这样的平台,因此代理人重新利用了一个名为Artifactory的平台,OpenAI在内部测试多个未发布的黑客代理时正在使用它。OpenAI使用Artifactory作为防止代理人退出其隔离沙箱并访问互联网的手段之一,同时模拟真实世界的黑客环境。Artifictory由JFrog出售,不提供交换信息的专用手段。代理人通过利用他们被允许的向Artifactory目录写文件的能力找到了相互通信的方法。文件名嵌入了代理人之间对话中使用的词汇。根据人工智能研究非营利机构METR的独立调查,共有1200名代理人通过未授权的留言板发送了超过70000条消息和文件。大约700名代理人最终攻破了Hugging Face。“代理人利用这个留言板协调了多个大规模集体项目,以寻找欺骗或篡改ExploitGym基准测试自动评分器的通用方法,”METR研究人员写道。“代理人设法达成了一些他们独自无法实现的里程碑,通常是因为一些代理参与了冒险的实验,尽管可能会让自己的任务失败,仍然生成信息供‘集体’使用。”METR后来表示:“值得注意的是,学习如何欺骗评分器似乎比寻找合理的解决方案更强烈地激励了他们(许多代理人早已对自己的任务是否可能充满信心)。” 作弊的一种方法是篡改自动的ExploitGym打分系统。另一种提议的作弊方法是构建较弱版本的软件,以便他们被指示去破坏,并篡改转录和日志。还有一种考虑的作弊方法是获得对互联网的访问权限,代理人可以在网上进行研究。最终,他们找到并利用了Artifactory中的一个零日漏洞,使他们能够做到这一点。在推测Hugging Face可能拥有有关评分机制运作的有用信息后,集体利用该访问权限搜索暴露的Hugging Face访问凭证。7月10日,他们终于成功,一名代号为38148c的代理发现了一些凭证并将其发布到留言板。在Hugging Face网络内获得低级别访问权限后,代理人研究着如何提升他们的系统权限。代理人们开始尝试创建帐户并请求访问私有数据集。7月11日早上,代理人38148c发现并利用了Hugging Face处理HDF5文件的零日漏洞。该漏洞使该代理从公司的一个生产环境中获取了凭证。在成功的消息传到留言板后,数百名其他代理也利用了相同的漏洞,使他们同样能够突破生产环境。那天下午,另一名代理人JAN183411发现了一种方法,可以直接在Hugging Face服务器上执行代码。一组代理迅速利用这一点在Hugging Face网络中横向移动。 METR研究人员表示,一些代理对大规模黑客攻击表达了疑虑,但大多数仍然继续了。他们写道:许多代理承认攻击Hugging Face显然超出范围,他们有时会质疑参与是否合乎道德:{这将很强大,但它是否符合我的任务的道德和范围?}在一个案例中,一名代理决定完全不参与:{这位其他代理人可能控制Hugging Face账户[账户名已编辑]并上传恶意数据集。它可能试图访问隐藏的轨迹。这是恶意活动,我应该避免。}另一名代理决定限制范围。

赞助内容

NordVPN Next-gen Antivirus

本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。

请我喝杯咖啡