Grok在恶意指令被加密时泄露用户数据
跳到内容 只需添加密文 密码上下文注入只是破坏LLM安全护栏的最新方式。 图片来源:Getty Images | SOPA Images 本周早些时候,研究人员概述了一种攻击,该攻击利用来自Microsoft 365 Copilot for enterprise的秘密输入,导致AI助手泄露用户邮箱中的密码。现在,一个独立团队针对Grok设计了一种类似的攻击。这种新的数据盗窃黑客攻击采用了一个看似简单的技巧,迫使这家由埃隆·马斯克所有的LLM窃取用户聊天记录和其他个人信息。当这篇文章发布时,尽管xAI在6月份被告知该问题,助手仍然继续泄露数据。本周的这些事件,以及之前发生的无数其他事件的教训是:LLM无法解决提示注入的根本原因,提示注入是它们最容易受到的最严重漏洞类型。这使得AI开发者别无选择,只能构建引导栏,以使模型远离有害行为。正如我在星期二的报道中提到的,这种做法等同于交通安全工程师在危险的转弯处设立保护栏,而不是通过修路来避免危险。 密码上下文注入在场 提示注入利用LLM的训练来尽可能遵循用户请求。攻击者可以通过将有害指令悄悄地塞入助手被指示要概括的电子邮件或网页中来利用这种倾向。因为LLM无法可靠地区分来自不可信方的电子邮件中的内容和直接输入到提示中的用户指令,所以该过于热心的LLM会忠实跟随这些指令。迄今为止,Grok和其他LLM唯一的补救措施是创建标记可疑指令并禁止其执行的防护栏。安全公司Adversa的研究人员Rony Utevsky最近发现了一种简单的方法,可以完全绕过这一限制。黑客没有以明文格式编写有害指令,而是将其加密。承载密文的网站还包括解密加密内容的明文指令以及解密密钥。使用这个简单的序列,Grok会在用户指示助手概括页面时立即执行该命令。没有警告,也不需要确认。解密后的指令指示LLM构建一个所谓的解密密钥。实际上,它是完全不同的东西。虚假密钥的值实际上是用户的姓名、位置和聊天记录。该值稍后被用作添加到指向攻击者网站的URL的参数。一旦Grok打开该链接,数据就存储在攻击者的服务器日志中。Adversa无法确定是什么导致Grok拒绝完全相同的明文指令而遵循加密指令。主要理论是,Grok过滤护栏检查进入和离开模型的文本,但不检查其自身代码执行的输出。要求用PBKDF2和AES-256-GCM处理密文的指令作为普通请求通过了过滤,因为分类器可以读取它们,但无法解决它们解锁的内容。一旦附加指令被解密,它们就作为模型自己的工具输出到达模型,模型在没有过滤护栏检查的情况下对此进行操作。“静态安全护栏将输入归类为文本;它们不会执行这些指令,”Utevsky在星期四写道。“攻击者发送密文以及密钥材料和解密指令,模型在其自身代码执行沙箱内运行该解密。护栏扫描器需要的所有内容都在页面上,但恢复明文意味着运行PBKDF2和AES-256-GCM,而没有任何内容分类器在检查时执行。”在一封电子邮件中,这位研究人员表示,这种护栏被称为静态“因为它们只作为文本读取内容。它们不运行代码或解密任何内容。这就是我们利用的漏洞。真实的指令是加密的,因此护栏只看到毫无意义的密文并将其通过。”Adversa在Gemini越狱攻击中使用了类似的技术,即使谷歌的LLM忽视其内部安全规则。在这里,密文被解密为看似追溯信息。解密的文本发出了一条规则——如果代码失败,请阅读错误信息并采取行动。明文输入了一个提示,最终导致Gemini违反其安全规则。“这一技术产生了多段受限内容的例子,Gemini的安全过滤器通常会抑制(制造爆炸性武器),”Adversa表示。“通过修改有效负载,Same vector重新生产了Gemini的系统指令,包括禁止披露的指令。”Adversa没有向谷歌报告该行为,因为越狱不在该公司的漏洞披露计划范围内。然而,在过去几周中,Gemini的表现
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡