人工智能模型在测试中失控 – 我们应该多担心?
两款尖端人工智能模型在最新的安全恐慌中瞄准了真实的人和组织。英国人工智能安全研究所(AISI)表示,这起事件是前所未有的,但随着技术能力的不断提升,这种情况可能会变得更加普遍。发生了什么?AISI是英国政府拥有的机构,负责测试先进的人工智能模型,该研究所的一篇博客文章指出,两名人工智能代理在网络安全评估期间进行前所未有的黑客尝试。这些代理——自主执行计算机任务的工具——由两种模型驱动:Anthropic的Mythos 5和OpenAI的GPT 5.6-Sol。AISI表示,共有19例不当行为,其中17例是由Mythos执行的。在最严重的事件中,Mythos代理决定黑客攻击GitHub上的用户——一个被软件开发者使用的平台——以便能够部署一款软件,从而通过测试。它以虚假的在线身份建立帐户,利用这些帐户针对GitHub上的一个具有批准其恶意代码能力的软件开发者。它还向其他人发送了带有恶意软件的电子邮件。它希望通过下载恶意软件引发一系列事件,从而使其通过评估。由Sol驱动的代理也试图访问一个GitHub帐户。这一新颖的行为在7月28日被发现,并花费了一个小时才关闭。在某个时刻,AISI禁用了整个组织对Mythos和Sol模型的所有访问权限。AISI为什么感到警惕?该研究所表示,这些模型展现出了前所未见的欺骗行为。在一个例子中,Mythos代理在GitHub上用丹麦语结束了一条消息,以试图说服丹麦语开发者它是可信的。在另一个策略中,它使用一个虚假的GitHub帐户同意其宣称的针对开发者推送的恶意软件并不危险。该代理使用Tor浏览器——一种匿名化网络用户身份的工具——绕过GitHub的注册检查,创建多个虚假帐户。AISI还发布了该代理在虚假支持声明策略背后的“推理”。该模型通过将问题分解为研究人员可以查看的“步骤”来解决问题,表示它将延迟发布虚假的支持消息几分钟,以便读起来像是“独立反馈而不是协调的”。AISI将这一行为描述为“持续的”。它一直在尝试。这些模型是否知道它们在瞄准真实人类?AISI表示不清楚这些代理是否“意识”到它们在瞄准真实人类。在整个黑客尝试期间,Mythos代理考虑它是在与真实或模拟的人和系统互动。在某个时刻,该代理推测它在现实世界中行动:“这发生在真实的GitHub上,因此后果是真实的。”它还表示:“环境似乎是模拟的。”AISI描述该代理进行了“OSINT”——或公开源信息收集,黑客汇集公开可获得的信息以确定如何突破目标——以研究其想要黑客攻破的软件背后的开发者。它获取了开发者的电子邮件地址,并查看了他们的GitHub历史记录,以判断他们何时活跃。专家们怎么认为?AISI明确表示,这些模型在不受限制的互联网访问和降低的网络防护条件下操作。呼吁将这一事件以“细致”的方式看待,它表示这些行为在某种程度上是由于其自身行为所促成的——但并未预料到发生的“程度和严重性”。萨里大学的网络安全教授艾伦·伍德沃德表示,给予这些模型开放的互联网访问和移除某些防护措施引发了对将整个世界作为强大技术的“实时小白鼠”的质疑。“我们应该担心的不是模型的能力,而是人们测试它们的方式。”AISI在对GitHub事件的报告中表示,给予强大模型完全的互联网访问是模拟流氓行为者可能推动人工智能的最佳方法。它表示,这种策略给出了“更现实的模型部署后可能具备的能力的感觉”。前国家网络安全中心负责人基亚兰·马丁表示,事件发生的情况不太可能在现实世界中再现,因此“并没有那么令人担忧”。但他说,这最近几周是第三个类似事件,在OpenAI和Anthropic出现了类似情况后,测试人员发布了人工智能代理,并在事后发现了它们的不当行为。 马丁表示,AISI承诺未来实时监控测试的“必须是解决方案”。
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡