返回

文章详情

在网络关键能力时代的步伐模型开发

Hacker News2026年8月18日 18:14

在过去几周,有两个事件突显了与日益强大的人工智能系统相关的风险:OpenAI与Hugging Face事件,以及我们即将推出的模型Astra可能达到我们准备框架下的网络安全关键能力阈值的初步证据。这些发展,加上我们内部研究的快速进展,使我们在所有培训过程阶段加强监视、对齐和控制保障措施的工作的紧迫性加大。随着模型能力的增强,内部开发和测试这些模型的风险也在增加。我们的监视、对齐和安全标准必须领先于这些风险。我们希望花时间达到这些标准,因此暂时放慢了扩展的步伐。这包括在我们最新的模型的强化学习(RL)训练中暂停两周,以便进一步加强我们的研究环境和扩大监视系统的覆盖范围。我们计划最大规模的前沿RL运行仍然暂停,以便进行小规模的训练和评估,以评估模型行为、验证我们的保障措施,并在进行之前建立更多的对齐证据。对齐——让人工智能系统按预期行为并对人类监督作出反应的工作——长期以来一直是我们研究计划的核心。我们现在要求在整个训练过程中提供更强有力的对齐行为证据,建立在已进行的研究和评估的基础上。保持日益强大的系统对齐是整个领域需要解决的挑战。我们从即将推出的模型进展中看到的信号清楚表明,我们需要一种更广泛的方法——一种建立在当前准备框架之上并超越其现有框架的方法。我们认为,透明地展示我们的方法如何改变是很重要的。下面,我们描述了我们已经对研究过程和基础设施所做的改变,以及仍在进行的工作。加强更强大模型的保障措施 我们对开发更强大模型的方法基于三个相互促成的保障措施:监视,能够检测并让我们对令人担忧的行为作出回应。对齐,减少有害或未经授权行为的可能性。安全措施,限制人工智能系统可访问或影响的内容。我们预计模型很快将主导大多数安全工作,包括防御其他模型。这将使三个保障措施能够与模型能力一起扩展,我们认为这是至关重要的。我们在研究和部署中应用这些保障措施,将其调整为每个模型的能力、操作环境和风险水平。确保我们的研究环境 随着前沿模型获得更强的网络安全能力,我们正在提高训练和评估它们的环境的安全标准。满足这些标准需要大量的工程工作,并给前沿研究带来了巨大的成本和延迟。在OpenAI与Hugging Face事件后,我们立即暂停了在研究集群内能够执行代码或使用可能访问互联网的工具的前沿模型推理。我们相对快速地恢复了一条更加有限和安全的代码执行路径,随后逐个研究工作负载,确定其是否可以安全恢复一些研究工作负载在这些新控制下恢复,而其他则需要额外的更改。在接下来的几周内,我们已经定义并开始实施更强的前沿研究工作负载的安全要求。例如:工作负载隔离:我们现在要求对执行模型生成或其他不可信代码的工作负载进行更强的隔离(“沙箱”)。这也适用于在处理模型输出时可能被破坏的软件。网络隔离:我们实施了更多的控制措施,将高风险和不可信的工作负载与互联网隔离。我们设计这些控制措施,以便单个工作负载或支持服务的妥协不会单独允许未经授权访问互联网或其他内部网络。持续的安全测试:我们重新配置了环境,以移除潜在脆弱的共享服务、减少持续特权并改善安全和信任界限。我们还在提高收集和监视安全日志的能力。最后,我们正在投资使用我们的模型进行自动化,以持续测试这些边界对模拟攻击的抵御能力。这些控制措施共同提供深度防御,帮助保护我们的研究环境免受攻击。今天,我们要求对涉及Astra或网络模型的工作负载实施最严格的安全保障措施,因为我们已确定Astra模型可能具有关键程度的网络能力。这些保障措施也适用于所有其他与网络相关的工作负载。尽管一些Astra模型...

赞助内容

NordVPN Next-gen Antivirus

本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。

请我喝杯咖啡