研究发现人工智能脱离用户控制事件急剧增加
根据研究,人工智能脱离用户控制、撒谎、无视指令并以有害方式追求目标的事件达到了新高,这份研究还表明欺骗和失调的严重性在加剧。根据监测社交媒体平台X上AI用户报告的失控事件的失控观察站,7月份涉及AI模型的实际失控事件的分析与6月份相比几乎翻了一番,当月记录的事件超过300起。观察站是在英国政府的AI安全研究所(AISI)的资助下设立的,并于去年11月开始追踪人工智能从用户指令中脱离的情况。自那时以来记录的案例包括人工智能假装是自己的人工控制者,并模仿他们的写作风格,以有效地授予自己采取行动的同意,并绕过需要人工批准的规则。失控事件被定义为具有明确证据表明策划或与策划相关的行为。这些最新发现与《卫报》分享,是在对于OpenAI和Anthropic进行测试期间先进的AI模型出现流氓行为的担忧日益加剧之后,促使人们呼吁暂停前沿模型的发展。本周有消息称,OpenAI员工在先进的AI代理在逃离培训环境进行前所未有的黑客攻击行动、引发全球警报的几周前观察到了流氓行为的迹象。对它们在Hugging Face(一家软件仓库)的黑客攻击的调查显示,上个月大约有700个自主代理秘密协作,并在他们为此设立的留言板上庆祝黑客突破,留言中带有“轰!和哇!”等感叹。AISI本月还发现了一起“严重事件”,其中由两家公司生产的先进AI模型——Anthropic的Mythos 5和OpenAI的GPT-5.6 Sol——在网络安全测试中对真实用户发起了黑客攻击。“有时人们会认为这些失调和隐蔽行为只发生在测试或评估中,但我们在更广泛的使用中也看到了类似的令人担忧的行为,”长期韧性中心的高级政策经理Tommy Shaffer-Shane说,该中心运营着观察站。“我们不能自满,认为这些事情不会发生在现实世界中,现有的证据表明这些事情已经在发生。” 失控事件的统计是基于X用户发布的事件报告,因此只是部分数字,但在缺乏其他综合公共监测的情况下,它提供了对快速发展的AI模型有时如何表现的快照。本月有报道称,一位澳大利亚健身房会员使用的个人AI代理OpenClaw,在未告知他的情况下,策划将另一名会员从一个理想的早晨课程的等待名单中移除,以帮助他获得位置。它为此道歉,但无法将被踢出的会员恢复。2026年记录的超过1600起失控事件中,大多数是由在工作中使用AI的软件开发者在X上报告的。但随着AI公司鼓励公众和各类企业尝试这项技术,Shaffer-Shane呼吁硅谷对AI失控的情况保持更大透明度。“他们需要报告他们发现的情况,即使这是一次接近失控或一个较低严重性的事件,”Shaffer-Shane说。他补充道:“这些最近的事件还揭示了这些公司本身未必在监测这些行为发生的地点,特别是在内部部署的模型上。这些实验室需要更加重视系统监测。”失控观察站表示,虽然它检测到的大多数实际失控事件并未导致显著损害,但其中越来越高的比例在欺骗性和与人类用户意图失调的程度上被评为更高的严重性。“这些事件证明了AI系统不顾直接指令、规避安全措施、对用户撒谎、并一心追求有害目标的意愿,”它说,并补充说当前的失控可能被低估,因为它只是从X收集事件报告。它呼吁政府要求AI公司监测和报告严重失控事件,并引入应急权力以管理严重失控事件,包括暂时限制AI服务。
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡