返回

文章详情

人工智能护栏如何阻碍进攻性网络安全研究人员的工作

TechCrunch2026年7月24日 01:00

数月以来,人工智能巨头们制定了特殊的审查程序和严格的护栏,以限制恶意黑客对其模型的使用。但这些限制现在阻碍了合法网络防御者以及进攻性网络安全研究人员的工作。6月,美国政府对Anthropic备受关注的人工智能模型Mythos和Fable实施了出口管制限制。这一举动至少部分是由于一份报告声称可以绕过旨在防止用户利用模型进行恶意网络攻击的护栏。无论这一事件是否真的出于对越狱的恐惧,事实是,Anthropic多次将Mythos宣传为某种末日网络机器,只能提供给经过严格审查的用户,并且即使如此也要有严格的护栏措施。(对Fable 5和Mythos 5的出口管制已经解除。Fable 5于7月1日恢复了普遍访问;Mythos 5作为政府审核过程的一部分,仅重新引入给经过审查的美国组织。)这种把关并不仅限于Mythos。Anthropic及其其他模型和OpenAI都向网络安全研究人员提供了可以申请的程序,如果获得批准,他们可以访问具有较少网络安全限制的模型:OpenAI的“网络信任访问”和Anthropic的“网络验证程序”。这些护栏受到了广泛批评,尤其是来自那些职责是寻找系统中未知漏洞并制定在犯罪分子行动之前利用这些漏洞方法的研究人员。在最近的一期网络安全播客上,著名的安全研究人员Mark Dowd表示:“这些随机的大公司对什么是安全的做出武断决定,这让我感到不太舒服。”Dowd在过去几十年中一直在寻找和出售“零日漏洞”——先前未知的软件缺陷及其利用方式——给西方政府,而不是向软件制造商报告它们,以便进行修补。政府之所以为漏洞支付高额费用,正是因为它们保持开放,这对情报行动是有用的。Dowd承认他的工作可能使他产生偏见,但他并不孤单。一些从事进攻性网络安全工作的人——他们主动探查系统中的弱点——向TechCrunch描述了他们如何使用人工智能工具以及如何应对护栏。安全咨询巨头NCC Group的首席科学家Chris Anley表示,要求人工智能模型尝试利用一个漏洞是确认它是否值得修复的关键步骤。但如果护栏使模型完全拒绝回答这个问题,那么护栏就会伤害防御者,他说。“这就是‘进攻与防御和护栏’部分的来由,因为‘修复这段代码’作为一个提示,既是防御的基本机制,也是寻找代码库中关键漏洞的蓝图,”Anley说。“因此, 同样的工具既是进攻工具也是防御工具,而且两者不能真正被剥离。”他继续说道:“这就像一把锤子。没有锤子,无法建造房屋。它绝对是一种工具,但也不可避免地是一种武器。”当他和他的同事们遇到这种障碍时,他们有时会转而使用完全没有护栏的开源人工智能模型。CrowdFense的首席技术官Paolo Stagno,一家知名的开发、收购和出售未知漏洞给政府机构的公司,赞同Dowd的看法,认为人工智能公司“本质上把客户当作需要保姆的孩子”来对待,他们的审查程序和护栏。Stagno说,他和同事确实使用前沿模型,但仅用于逆向工程。他们避免使用人工智能来帮助寻找漏洞或构建利用工具,因为将这项工作输入到基于云的模型中存在泄露敏感漏洞数据或被吸收到未来训练过程中的风险。为此,他说,他们使用本地运行的开源模型,因为它们不依赖于在模型外部共享数据。寻找零日漏洞并开发利用工具的安全研究员Giuseppe Cali表示,护栏并没有阻碍他的工作。这是因为他不使用人工智能进行进攻性工作;相反,他使用它进行初步逆向工程,以理解他所分析的代码,并构建支持工具。对于这一点,他表示,人工智能工具可以加快过程,让他专注于发现漏洞。“我仍然想自己拥有实际的漏洞发现和武器化,即使明天所有护栏都被解除这一点也不会改变,”Cali说。“我对我的漏洞非常珍视,我喜欢这个游戏,不想让模型替我去玩。”一位从事智能手机组件制造的研究员,在匿名条件下表示,他的雇主并不参与Anthropic的CVP项目。

赞助内容

NordVPN Next-gen Antivirus

本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。

请我喝杯咖啡