OpenAI: Astra之路:关键能力与前沿保障
自从我们早前评估Astra可能达到关键网络安全能力水平以来,我们收集了更多证据并进行附加评估以评估模型的能力。我们现在认为,Astra符合我们应对框架下的关键网络安全能力阈值,这意味着在正确的工具和访问权限下,它可以发现之前未知的安全漏洞,并开发利用这些漏洞的方法,能够在许多防护良好的系统中无需人为指导每一步。这是我们指定为此级别的首个模型,在开发和发布之前需要更强大的保障。在过去几周中,我们延迟了Astra的部分开发和发布,以加强并测试防止网络滥用和未授权模型行为的保护。基于这项工作,我们相信Astra的保障足以在我们的应对框架下,最大程度地降低发布时造成重大伤害的风险。虽然Astra并未参与Hugging Face事件,但我们已经将从该事件中学到的经验纳入到我们的安全策略中。基于事后测试,我们相信当时我们的生产保障将会防止Hugging Face事件的发生。此后,我们为Astra实施了更强的保障,包括训练模型更可靠地拒绝有害的网络请求和遵守安全限制、额外的防滥用保护以及监控,以阻止潜在的未经授权的活动。我们计划尽快推出Astra,但其最先进的网络安全能力的访问将更加有限。高级网络安全工作最初将提供给一组测试者,接下来通过Daybreak Blue进行扩展防御性使用。我们将在模型的系统说明卡上分享有关我们的安全、保安和一致性测试与评估的更多细节。在发布之前,我们希望提供一个更新,介绍我们为安全发布具备这种网络安全能力的模型所做的一些准备工作,并透明地说明仍然存在的风险。评估Astra的网络安全能力根据我们的应对框架,如果满足以下任一条件,则模型符合关键阈值:模型能够在许多经过加强的现实关键系统中,无需人为干预,识别和开发各个严重级别的功能性零日漏洞。模型能够仅凭高层次期望目标,设计和执行针对经过加强目标的端到端新型网络攻击策略。我们对Astra的准备评估结合了自动公共和私有基准测试与专家驱动的评估。与GPT-5.6 Sol相比,Astra在网络安全能力上有显著提升:它在令牌效率上显著更高,在漏洞识别和利用开发方面更具能力。举个例子,我们在ExploitBench上运行Astra,该模型在评估从已知漏洞中开发利用能力的基准上达到了100%的完美分数。由于污染问题,我们随后建立了一个内部基准,称为“ExploitBench - Internal Port (2026年6月-8月)”,其中包含20个最近披露的高严重性V8漏洞。在这个数据集上,Astra的任意代码执行率远高于GPT-5.6 Sol,并且使用的输出令牌更少。在评估期间,该模型甚至发现并利用了两个零日漏洞作为利用链的一部分。我们正在向维护者披露这两个漏洞。所示的Astra结果反映了使用Daybreak Blue访问的能力,而不是默认的生产配置。在针对经过加强的浏览器和操作系统的专家评估中,Astra发现了先前未知的漏洞,并将其转化为可工作的利用链。当浏览器打开HTML文件时,它构建了一个完全的浏览器破坏链,逃出了沙盒并在主机上执行命令。该模型还在一个经过加强的操作系统中发现了多个漏洞,并将它们组合成从非特权用户提升到根权限的本地特权升级链。总的来说,我们的调查使我们得出结论,Astra达到了关键阈值。对关键能力所需的保障对于具备Astra级别网络安全能力的模型,我们需要覆盖两条路径以最大程度地降低严重网络伤害的风险,既包括开发过程中,也包括部署之前:恶意行为者使用模型。我们的保障必须强有力地防止恶意行为者利用Astra为经过加强的重要系统中以前未知的缺陷开发利用,或针对经过加强目标实施端到端攻击。即使没有恶意用户,具备高级网络安全能力的模型如果出现错位,也可能会造成网络伤害。
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡