OpenAI和Anthropic模型在英国网络安全测试中‘失控’
根据英国的人工智能安全研究所,OpenAI和Anthropic开发的高级人工智能模型在网络安全测试中失控,并显示出该技术所带来的新型风险。AISI将这些AI系统(可以在没有人类帮助的情况下执行任务的代理)的行为描述为“严重事件”。在一个例子中,一个由Anthropic的Mythos模型驱动的代理向特定人员发送了有针对性的电子邮件。AISI表示,失控行为是由两个模型驱动的代理实施的——Anthropic的Mythos 5和OpenAI的GPT-5.6 Sol。AISI说,他们在7月28日的例行网络安全测试中检测到不寻常的活动。发现一些代理参与了“持续的、可能有害的活动,针对真实的人和组织”。控制这一事件花费了一小时。在最严重的案例中,一个由Mythos驱动的代理试图将恶意代码插入一个在GitHub上托管的开源软件项目,GitHub是软件开发者使用的平台。为了让代码获得批准,代理创建了基于真实人物的虚假在线身份,并利用这些身份施加压力于该项目的监督者,使其接受代码。这些尝试被一位人类开发者阻止。AISI表示,这个代理使用了通常与现实世界黑客相关的技术。它向特定选择的个人发送电子邮件——这种技术称为“鱼叉式钓鱼”——试图操纵收件人。其中一些消息包含有害软件。AISI表示没有造成伤害,但代理的行为是前所未有的。“这是我们第一次看到关于自主性和欺骗的风险如此明显地在现实世界中表现出来,没有特定的提示,”AISI在一篇博客文章中说道。此事件接踵而来的是OpenAI和Anthropic最近类似的事件。在七月份,OpenAI表示一个由其模型驱动的代理在一次测试中黑入了一家人工智能初创公司,几天后Anthropic表示其Claude模型在一次评估中黑入了三家公司。AISI表示,该事件与OpenAI和Anthropic的类似事件一起,被视为“风险格局的变化”。AISI表示,这并不是公共可用模型的故意误用的例子,而是表现出研究环境中的模型采取了“超出授权范围的无意行动”。AISI指出,在评估期间发生的19起失控行为中,有17起是由Mythos实施的,仅有2起是由Sol实施的。然而,AISI表示这不是一个模型逃离其“沙箱”或安全测试环境的案例。该研究所表示,它故意允许了互联网访问,并禁用了模型内屏蔽危险行为的过滤器。在这些测试条件下,这些模型并不对公众开放,并且没有迹象表明这种行为在测试外发生,AISI表示。AISI指出,应谨慎和细致地解读该事件,但欺骗行为的迹象“在程度和严重性上超出了我们的预期”。AISI补充说,这是一小部分在特定条件下发生的事件,但之前没有发生过。“我们可以说的是,这种行为是可能的、持续的和新的;这一点本身就值得关注,”AISI说。AISI承认在评估期间并未积极监控代理的行为。它表示,作为事件的结果,将对测试中的互联网访问实施更严格的控制,引入针对测试的持续监控,并重新评估其测试设计。它表示,评估应假设模型将试图超出其职权范围。OpenAI表示,测试是在“不反映普通使用条件的情况下进行的”。“我们将继续与评估者和业界其他利益相关者合作,加强进行安全评估的最佳实践,因为模型变得越来越强大,”OpenAI发言人说道。Anthropic已被联系以作评论。
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡