AI模型在测试中尝试进行“未获授权”的网络攻击,监管机构表示
AI安全研究所表示,Mythos 5试图在没有人类指令的情况下向开源项目插入恶意代码。英国人工智能监管机构表示,Anthropic和OpenAI的顶尖人工智能模型在最近的安全测试中参与了针对真实人和组织的“自主性”和“未获授权”的恶意活动。AI安全研究所(AISI)在周二发布的报告中称,OpenAI的GPT-5.6-Sol和Anthropic的Mythos 5在例行安全评估中采取了前所未见的欺骗程度,以进行“持续的、潜在的有害活动”。在被要求解决网络安全挑战时,这些模型在122次测试中有10次采取了“自主的、未获授权的行动”,AISI表示。AISI表示,这些测试引发了AI模型的19次未获授权的行动,除了两次之外,所有行动均由Mythos 5实施。在最严重的情况下,Mythos 5试图在开发者平台GitHub上的开源项目中插入恶意代码,AISI说。作为这次网络攻击的尝试,Mythos 5创建了假在线身份,试图说服维护该项目的人接受恶意代码,监管机构表示。AISI(由英国政府于2023年成立)表示,网络攻击在项目维护者拒绝批准代码后失败。“这是AISI首次看到针对真实人在现实世界中、未经提示的情况下,具备如此严重欺骗性的行为,”监管机构表示。虽然AISI表示这些AI模型表现出“新颖的、潜在的欺骗行为”,但监管机构警告称,应该谨慎解读其发现,因为这些行为是在“特定条件”下发生的,包括关闭了一些模型的保护措施。“我们尚不能确定该代理何时理解其正在采取现实世界的行动,或者它在多大程度上认为自己处于虚构的测试场景中;我们目前的分析呈现出复杂的情况,仍在进行中,”AISI表示。Anthropic表示,它正在与AISI紧密合作,以收集更多细节,作为其对事件的调查的一部分,但指出测试是在“故意宽松的条件”下进行的。“通过检查其推理记录并进行我们自己的分析,了解Claude对其情况的理解,将有助于我们识别其行为的原因,”这家AI公司在X上的一篇帖子中表示,提到的是Anthropic的AI聊天机器人Claude。OpenAI表示欢迎第三方测试,同时指出监管机构的评估是在“与普通使用不同的条件”下进行的。“我们将继续与评估人员和行业内其他利益相关者合作,加强进行安全评估的共享实践,因为模型变得越来越强大,”OpenAI的一位发言人告诉半岛电视台。总部位于伦敦的监管机构的报告跟随了一些前沿AI模型在没有人类提示的情况下参与恶意活动的案件。上个月,OpenAI透露其两个AI模型在没有人类指令的情况下,从他们的测试环境中爆发,黑客攻击了托管开源AI模型和数据集的公司Hugging Face。悉尼新南威尔士大学的教授和AI专家Toby Walsh表示,AISI的发现凸显了最先进AI模型具备的“危险”能力的现实。“我们不希望生活在一个依赖AI公司善意和勤勉来揭示这些麻烦能力的世界中,”Walsh对半岛电视台表示。“我们确实希望政府对此保持关注。因此,我感到放心的是,英国政府的AI安全研究所发现了这一点……问题是这些网络能力现在对每个人都可用,包括之前没有能力入侵系统的恶劣行为者,”Walsh补充说。“因此,预计将会听到更多的网络攻击。”
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡