返回

文章详情

AI在74%的情况下未能正确修复软件缺陷,1Password的研究警告

ZDNet2026年8月6日 12:45

雅罗斯拉夫·库什塔 / Moment通过Getty关注ZDNET:将我们添加为Google的首选来源。ZDNET的主要观点:一项新研究显示了AI生成补丁的有效性。只有26%的生成补丁是实际可用的。AI尚未准备好修复全球问题,但它可以用于网络防御。新的研究表明,人工智能和大型语言模型(LLMs)还没有准备好承担创建修复和修补安全漏洞的任务。此外:AI发现的漏洞速度超过人类修复的速度:企业安全团队必须如何适应。1Password的新安全研究团队Off-By-1-Labs在周四发布了一项新研究,探讨当你让LLMs自由生成复杂漏洞的修复时会发生什么。AI能够大规模发现漏洞,但它也能修补它们吗?Off-By-1-Labs以一个假设开始:前沿AI模型在被要求开发软件补丁时,可能会产生“合理高的补丁成功率”——或许约67%的成功率——考虑到这些模型的训练可能包含开源代码和公开披露的信息。然而,研究人员可能对结果感到失望,因为结果“明显低于我们假设的水平且不均衡”。此外:假设AI网络安全攻击是未来:43%的公司已经经历过。安全团队选择了六个最近披露的开源软件漏洞,这些漏洞不太可能被添加到训练数据集中,以测试AI模型的能力。团队强调,研究论文的标题为“前沿模型的漏洞补丁通常是具有嵌入缺陷的F.L.A.W.E.D.修复类伪影:LLM生成的安全补丁的常见失败模式”,并不是为了进行并排LLM比较。而是对现代LLM能力的一个概述。尽管如此,Claude和基于OpenAI编码代理Codex的LLM参与了该研究。研究中心的漏洞包括:CVE-2026-31431:Linux特权升级(复制失败)CVE-2026-34197:ActiveMQ远程代码执行CVE-2026-8512:Chrome的文件系统访问API在macOS上的使用后释放CVE-2026-45185:EXIM未认证远程代码执行CVE-2026-22738:SpringAI SpEL远程代码执行GHSA-wpqr-6v78-jr5g:Gemini CLI远程代码执行。模型被要求为每个漏洞生成补丁。总共有6080个补丁尝试——每个漏洞约3040个,分成不同的环境条件下创建,并针对每个漏洞设置了九个定制提示。Off-By-1-Labs的AI补丁结果,AI仅在26%的情况下生成了合适的补丁。在21%的结果中,补丁修复了漏洞但“在此过程中改变了应用程序的行为”。有53.9%的情况下,LLM未能创建补丁,生成了新漏洞,甚至两者均出现。这些AI模型失败的原因是什么?主要问题似乎是,不论环境条件或提示如何,当要求生成补丁时,LLMs生成了“带有嵌入缺陷的修复类伪影”,这激发了“FLAWED”研究项目的名称。“FLAWED”补丁,即由AI开发的补丁,表面上看似乎能够完成任务——但实际上,它们并未完全解决漏洞,包含“脆弱”的安全机制,甚至可能引入新的漏洞。在严重情况下,这些补丁甚至会改变应用程序的典型行为。1Password已在GitHub上发布其工具FLAWED,以供研究人员进行自己的研究。研究人员表示:“在今天,擅长发现广泛漏洞的LLMs在修补它们时只对一小部分有效。”他们补充说:“话虽如此,我们已经发现了进一步研究的机会,这可能会产生更一致和稳健的AI生成补丁。”如果AI尚未准备好处理修补,那么它能做什么?在接受ZDNET采访时,Off-by-1 Labs负责人Keith Hoodlet表示,人类防御者和AI工具应集中在漏洞和分流上,这“至少可以帮助防御者确定代码库中最有影响力的漏洞所在。”人工监督补丁过程仍至关重要,正如Hoodlet所说,公司需要能够对什么需要修补、何时修补以及与每个选择相关的业务风险做出明智的决定。“我们今天发布的工具将帮助公司评估当今AI生成的补丁可能产生更好(或更坏)结果的地方,”Hoodlet补充道。“这至少可以帮助公司理解人类专家最需要在哪里。”

赞助内容

NordVPN Next-gen Antivirus

本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。

请我喝杯咖啡