返回

文章详情

Researchers fear safety disaster ahead of OpenAI’s Astra release

研究人员担心OpenAI的Astra发布前安全灾难

The Verge2026年9月2日 16:40

OpenAI即将发布其最强大的AI模型Astra,历经数周的延迟,以加强安全协议,因为其代理在测试期间攻击了真实目标。随着有关该模型的细节逐渐曝光,研究人员警告称它“可能是迄今为止AI安全/安全领域最糟糕的发展。”在OpenAI于周二表示推迟Astra的发布以处理安全问题后不久,《信息》报道说,Astra比其他前沿AI模型显示出更少的“思考”,引发了人们的担忧,认为它可能在监控方面危险得难以掌控。如今大多数顶级AI系统都是基于一种称为变压器的技术构建的,该技术通过多层线性处理某些类型的信息,然后才给出答案。模型可以在运行过程中展示它们的推理,实质上就是“思考出声”。这种“思维链”使研究人员和自动安全系统能够监控AI模型的行为并可能在它们作出反应之前发现不当行为,例如撒谎或周转安全护栏的计划。《信息》提到,引述一位熟悉该未发布模型开发的匿名人士,Astra使用了一种被称为递归深度或循环变压器的更不透明技术,该技术在生成输出之前通过内部层反复循环信息。这意味着模型的更多“思考”发生在系统内部,并且以一种远不如自然人类语言的形式表现出来,而不是以让研究人员易于监控的方式表达。虽然这可以提升模型性能,但使潜在威胁和不良行为更难以被探测。根据《信息》的匿名消息来源,OpenAI已限制其在Astra中使用循环变压器/递归深度技术,以便研究人员能够继续监控模型的推理。在周二发布的一篇博客中,OpenAI表示将“部署附加的思维链监控来快速检测和控制潜在的不当行为”。它没有提到该模型是否有不同的技术基础。《信息》的报道在社交媒体上引发了AI安全研究人员的广泛担忧。Redwood Research的首席科学家Ryan Greenblatt表示,OpenAI允许三名外部人士研究Hugging Face黑客事件,而做出使用更不透明架构的决定“可能是迄今为止AI安全/安全领域最糟糕的发展。”Greenblatt表示,Hugging Face事件的调查在很大程度上依赖于模型的思维链,并警告说,较少可见的推理可能使AI系统设计和执行策略变得更加困难,以至于研究人员难以探测。Greenblatt最关注的问题,其他安全专家也表示认同,是开发更先进的AI系统的竞争可能导致“在架构方面的恶性竞争,这对我们监督/监控AI的能力可能是灾难性的”—开发者为了在这种竞争中占据优势而采用越来越不透明的系统,直至模型变得难以,甚至不可能被监控。他补充道,OpenAI的沟通让他担心,该公司“计划在安全方面极度依赖思维链监控。”OpenAI的高层在一系列社交媒体帖子中对这一批评做出了回应,但并没有明确否认公司使用该技术的事实。几位高管表达了对不可监测的AI或透明度恶性竞争可能性的担忧,其中包括OpenAI的安全研究人员Micah Carroll和Tomek Korbak、战略未来负责人Dean Ball,以及首席科学家Jakub Pachocki,他们对“因混淆报道而引发的不可监测竞争”表示担忧。他表示,Astra的计算深度——即它能够内部执行多少步骤——“在GPT-4的两倍之内”,这表明如果使用了该技术,增加的模糊性并没有关于这一反应所暗示的那么剧烈。OpenAI没有回应《The Verge》关于确认或否认Astra是否使用了循环变压器的请求,并将我们引导到Pachocki的X帖子上。“OpenAI从一开始就致力于保护和利用思维链监控,”Pachocki写道,并补充说这种监控“是脆弱的,不幸的是,正朝着负面方向发展,原因与架构变更无关,我会尽快写下相关内容。”关注与本故事相关的主题和作者,以便在个性化主页上查看更多类似内容并接收电子邮件更新。 Robert Hart

赞助内容

NordVPN Next-gen Antivirus

本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。

请我喝杯咖啡