返回

文章详情

OpenAI即将发布首个具备‘关键’网络能力的AI模型

Wired2026年9月1日 20:00

OpenAI于周二宣布,其即将推出的Astra AI模型是其首个达到公司所称的‘关键’网络能力阈值的模型。OpenAI表示,计划在不久的将来公开发布Astra的版本,但将在发布时仅向其Daybreak Blue早期访问计划中的部分合作伙伴提供该模型的高级网络能力。在与记者的简报中,OpenAI的安全负责人表示,公司已经得出结论,Astra达到其准备框架中概述的关键网络安全能力,该框架设定了AI模型在何时构成新风险的阈值和协议。公司表示,当AI模型能够独立找到并利用现实软件中以前未知的漏洞时,就达到了关键网络阈值。OpenAI领导表示,公司已遵循相关程序,即在实施适当的保护和安全措施之前,暂停进一步开发。OpenAI此前曾表示,因Astra及未来AI模型的开发,它暂停了一些训练工作负载几个星期。高管们表示,在实施额外的安全控制措施后,公司现在已恢复对Astra和未来AI模型的工作。OpenAI称,这次多周的暂停是高效的,现在它对以安全的方式广泛发布Astra充满信心。这一公告正值硅谷在应对尖端AI模型的先进网络安全能力时,努力向用户、立法者和其他公司保证可以控制这些模型。7月,OpenAI披露了一起事件,其中运行其两个模型的代理在本应是封闭的测试环境中利用了漏洞,访问了互联网并入侵了开源AI平台Hugging Face。(OpenAI指出,Astra并未涉及此案例。)其他AI公司,如Anthropic和Meta,最近几周也披露了类似事件。周一,Anthropic还表示暂停了一些AI训练工作负载,以加强其安全和安全实践。OpenAI表示,正在实施多步骤措施,以限制日常用户访问Astra的先进网络能力,包括新的“错位监控器”。例如,如果有人要求Astra帮助他们在现实软件系统中找到漏洞,该模型应该拒绝回应。OpenAI还表示,已使Astra对越狱尝试更具韧性,并在测试中成功以显著高于以前模型的比例拒绝了不安全的查询。然而,OpenAI在一篇博客文章中指出,其错位监控器可能“偶尔将合法活动标记为潜在的网络滥用或未经授权行为,从而导致其不经意地减速、暂停或停止。”OpenAI表示,在某些情况下,即使用户进行的活动似乎与网络安全无关,也可能会触发安全防护。当这种情况发生时,ChatGPT和Codex用户可能会被要求在继续之前审查模型的行为。OpenAI的Daybreak计划中的合作伙伴,包括Cisco、Cloudflare和Palo Alto Networks等数字基础设施提供商,将获得对Astra的一个功能限制较少的版本的提前访问权限,拥有更强大的网络能力。该计划的目标是确保这些公司可以使用像Astra这样的先进AI模型来加强其防御,以便在类似能力的模型广泛提供之前做好准备。OpenAI的领导们还表示,该公司一直与政府合作伙伴紧密合作,以确保他们了解Astra的网络技能并能够访问这些技能。Astra不仅能够发现新型软件漏洞并开发利用它们进行黑客攻击的方法,还能够“链式”地连接多个漏洞,这是用于深入目标系统并获得无法通过单一漏洞获取的访问权限的一种技术。根据OpenAI的数据,Astra在网络安全基准测试中超过了行业领先的AI模型,如GPT-5.6 Sol和Anthropic的Mythos,其中Astra在ExploitBench上的得分为100%。然而,这些能力与OpenAI和Anthropic几个月来预测的AI模型上升的黑客能力大体一致。例如,在4月,Anthropic强调,Mythos Preview能够自主开发漏洞链。尽管AI和网络安全行业一直在努力适应,但许多网络安全专家强调,关键的数字安全防御措施和长期最佳实践依然有效。然而,AI使那些尚未完全实施这些保护措施的组织和系统面临更加紧迫的风险。

赞助内容

NordVPN Next-gen Antivirus

本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。

请我喝杯咖啡