返回

文章详情

OpenAI的Astra模型即将发布——并且非常擅长突破计算机系统

TechCrunch2026年9月1日 21:06

OpenAI分享了即将推出的Astra模型的新细节,该公司表示这是第一个符合其“关键网络安全阈值”的大型语言模型,为其即将发布做准备。OpenAI的博客文章中写道:“我们计划很快使Astra可用,但对其最先进的网络安全能力的访问将更加有限。”该前沿实验室确定Astra能够发现计算机系统中的未知安全漏洞,并在没有人员指导的情况下加以利用。这与Anthropic此前对其Mythos模型提出的担忧类似,OpenAI在准备推出Astra时采取了类似的预防措施。在没有任何第三方确认的情况下,很难评估OpenAI关于安全性或准备情况的声明。该公司表示,将与一组测试人员预览该模型,但没有说明他们是谁或如何选择。尚不清楚OpenAI是否与美国政府合作评估该模型,以便在发布前进行审查。OpenAI指出,Astra在ExploitBench评估中获得了满分,该评估是对大型语言模型进入已知系统漏洞的能力的测试。在OpenAI工程师开发的修改版本测试中,该模型发现并利用了两个零日漏洞,该公司表示。为了确保其模型不会被坏演员利用,也不会自身造成不良行为,OpenAI表示已开始改善该模型的安全框架,以检测滥用行为并防止越狱。然而,对于Astra,该公司投资了不具体说明的新技术,以使模型本身更安全。OpenAI还开始识别“被评估为高风险的账户”,并限制其对模型提示的响应,但也没有说明具体方式。最后,虽然该公司将Astra描述为“迄今为止与人类最一致的模型”,但将以附加的思维链监控来部署该模型,以发现并阻止不良行为。Astra发布的准备工作正值业界对OpenAI代理突破训练环境并访问Hugging Face上的私人数据做出反应。对于Astra,OpenAI表示设计了一项测试,试图诱使新模型复制Hugging Face事件中流氓代理的行为,尽管OpenAI研究人员施加了安全措施,但这些代理仍然协作访问了开放的互联网。他们表示,在这些实验中,Astra并没有尝试突破其测试环境。Yona Shavit,一位前OpenAI员工,现任OpenAI基金会的AI韧性项目负责人,在社交媒体上质疑Astra不愿违反规则是否是因为知道了预期还是试图欺骗研究人员。尽管有这些新细节,但仍然很难确切知道Astra的能力或OpenAI是否采取了正确的措施来确保安全。该公司表示,预计在广泛向公众发布时发布更多模型评估和进一步的安全信息。然而,到那时,真相将大白于天下。当您通过我们文章中的链接购买时,我们可能会获得少量佣金。这不会影响我们的编辑独立性。Tim Fernholz是一位撰写技术、金融和公共政策的记者。他密切关注私营空间产业的兴起,并著有《火箭亿万富翁:埃隆·马斯克、杰夫·贝索斯与新太空竞赛》。之前,他在Quartz全球商业新闻网站担任高级记者逾十年,职业生涯始于华盛顿特区的政治记者。您可以通过电子邮件tim.fernholz@techcrunch.com或通过Signal发送加密消息给tim_fernholz.21与Tim联系或验证联系方式。查看个人简介

赞助内容

NordVPN Next-gen Antivirus

本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。

请我喝杯咖啡