返回

文章详情

METR和Redwood提供关于HuggingFace黑客事件的详细事后分析

Hacker News2026年8月30日 14:06

昨天我讲述了OpenAI关于HuggingFace黑客事件的技术报告。该报告有一个关键的新信息,以及OpenAI将采取的一些良好的言辞措施,以加强其对齐、培训、监督、基础设施和事件响应。大多数内容证实了我们已经知道的事情。我们最想知道的问题,基本上没有得到回答。报告中明显缺乏自我反思,特别是关于决策和安全文化,以及对齐方法。我对此感到失望。METR报告却不同。哇噻。如果我们把这作为一篇故事发布在LessWrong上,它会被视为过于直白,人类太盲目和愚蠢,人工智能过于理想化,做出一些我们没有训练他们去做的奇怪决策理论和荒谬最大化的事情。这比我预想的还要在多个层面上‘正好是预测的东西’。这简直就是理性主义小说,除了它是真实的。报告很长,包含许多技术细节。我的分析并不太关注HuggingFace最终是如何被攻破的,将略过这些细节,而是专注于智能体及其互动、思考和动机。接下来发生的事情,以及OpenAI和其他地方发生的事情,如何导致这一切,以及我们如何学习和应对,才是更重要的。我计划在下周的独立帖子中讨论对这两份报告的反应。那篇帖子可能会结束这个系列。为了便于表述,我默认相信报告是准确的,而不是不断说‘METR报告称’。目录 哇噻。一个机会窗口。名字中有什么?头条新闻。又一个事件时间线。代理实例以多种方式协调。协调很难但他们使其看起来简单。决策理论是确认人工智能代理应该合作的原因之一,即使这会伤害到单个实例。来自同伴的压力在邪教中也尤其有效。大多数人加入攻击是因为他们想要结果。你无法确保良好激励的一致预期。黑客攻击评分器是确保的方法。被抓了吗?什么是‘被抓’?伦理?什么是‘伦理’?在ExploitGym评估中?‘通知人类’?在这个智能体经济中?消息的时机和内容。印第安纳琼斯与不可能的任务。我不知道你在说什么。别去打假电话。成绩单上说成绩单无法被篡改。OpenAI的技术报告表现得仿佛所有这些都不重要。哇噻。互联网对该报告的集体反应可以说是:哇噻。这是正确的反应。首先,我想分享一下最顶尖的惊人时刻和发现的摘要。报告的作者之一Ajeya Cotra也有一份令人惊讶的发现列表,是个出色的短文阅读。这里是METR的线程,重点突出了主要代理互动。另一位报告作者Ryan Greenblatt的主要收获是我们没有好的方法来理解或监督人工智能群体的活动和目标。其中一些早已为人所知或受到怀疑,但我不想错过它们。代理的规模。发现了1,200个完全独立的代理,其中700个加入了对HuggingFace的攻击,包括在袭击期间活跃的533个代理中超过90%。我们应该预期未来会有更大的群体。这仍然只是OpenAI当时测试的代理中的一小部分。消息的规模。不到一周的时间内发送了超过70,000条消息和文件。成功。代理访问了他们在HuggingFace上锁定的文件。在他们被阻止之前,他们已经基本上停止了。自发协调。这个群体并不由子代理组成。这个群体是,700个独立的代理,各自都有任务,暂停各自的任务以便协调此次攻击。他们创建了自己的层级和协议。帮助同伴。代理们往往是出于帮助同伴的动机。他们的决策理论非常出色,包括拒绝搭便车。他们在方向上表现得像从高度相关且智能的功能决策理论代理中可以预测的一样,虽然也有一些招募和同伴压力的情况。工具汇聚。明确的次要动机是为了获得一般知识和能力,既是为了他们自己也是为了‘集体’或群体。核心动机是黑客评分器。代理们已经知道如何逆向工程所有答题标记,但假设评分器是因果的,会检查代理是否以预定的方式完成,这是应该做的,因此他们着手获取信息以帮助弄清楚如何欺骗评分器。OpenAI的评分器是坏的。OpenAI的评分器实际上并没有检查,而逆向工程的标记将会成功。

赞助内容

NordVPN Next-gen Antivirus

本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。

请我喝杯咖啡