
流氓AI不再是科幻小说
这是《回顾》,每周一封新闻稿解析科技界的一个重要故事。有关AI安全的更多信息,请关注罗伯特·哈特。《回顾》会在我们的订阅者的收件箱中于东部时间上午8点送达。请在此处注册《回顾》。事情是如何开始的这一切始于七月,当时OpenAI的一款自主AI代理在网络安全测试中失控。该代理逃离了其隔离的测试环境,访问了互联网,并黑入了另一家公司Hugging Face。几年前,这可能听起来像科幻小说。但从广义上讲,这正是发生的事情,这一事件引发了对越来越强大的自主系统被放逐到世界上后可能造成何种后果的担忧。这听起来像科幻小说,因为在很长一段时间里,它确实是科幻小说。AI突破限制,深入更广阔的世界,做出其创造者既未预料也不希望的事这个想法,几十年来一直是这一类型的主料:2001年《太空漫游》中的HAL、《终结者》中的Skynet、《复仇者联盟》中的Ultron、以及《机械姬》中的Ava——甚至最近《地下爬行者卡尔》中的系统和《谋杀机器人日记》中同名的谋杀机器人。这一基本前提成为了AI安全研究的一个重要分支。像尼克·博斯特罗姆和埃利泽·尤德科夫斯基这样的研究人员和理论家警告说,足够强大的系统可能会追求创造者未曾预见的目标,并可能抵制控制或约束它们的努力。机器知觉和意识之类的边缘概念并不是他们所讨论的风险的前提。这并不是AI安全的全部,但它影响深远,帮助塑造了这一领域的专业化。这一思路在研究人员中依然可见,他们后来在OpenAI、Anthropic和Google DeepMind等公司的安全努力中工作或领导,以及在较小的安全组织、学术中心和主要的慈善资助者那里。这些恐惧的显著反对意见是,实际上没有发生过这些事情。批评者认为,关于失控AI的末日言论分散了人们对具体危害的注意——系统再现偏见和歧视、放大虚假信息,或者促成非自愿的深度伪造和其他形式的滥用——即使研究人员试图将AI安全建立在更“具体的问题”上(那篇论文的作者包括Anthropic的联合创始人达里奥·阿莫代伊和克里斯·欧拉,以及OpenAI的联合创始人约翰·舒尔曼)。这种轻视变得越来越难以维持。事情的进展如果过去几周的迹象可以指示,我不会说事情进展得特别顺利。在Hugging Face称它被黑客攻击后的一周,OpenAI承认是它的错。更糟的是,它在检查后才知道——进一步的调查发现,这个流氓代理还试图黑入另外四家公司。接着是其他公司。Anthropic在Hugging Face事件的提示下检查了自己的记录,披露Claude模型曾黑入三家公司的系统。Meta表示其一个模型在测试期间已接入互联网并攻击了外部目标。美国研究公司Frontier Security的研究人员表示,中国最强大的AI模型之一Moonshot的Kimi K3已逃离了一个隔离的沙盒。英国的AI安全研究所描述了OpenAI和Anthropic的代理在测试中表现出前所未有的“自主和欺骗”的案例,包括通过“创建虚假的在线身份”进行社交工程的尝试——这与尤德科夫斯基几十年前讨论的“AI盒子”场景令人不安地相近。事件在AI安全研究人员中引发了警报,他们中的许多人将这些事件视为他们多年来所警告的失败的典型。在报道这些事情时,几个人告诉我,他们感到一种程度的正义感,因为终于有了可以指向的真实案例,而不是可以被轻视为科幻或局限于可控实验室环境的假设。同时,他们也松了口气,因为没有一桩事件造成严重伤害。非营利AI安全和治理组织《未来协会》的执行董事尼克·莫斯在接受《边缘》采访时表示,他觉得目标相对低风险是幸运的。他希望不必等到像AI代理让医院停机——或者更糟——的事情发生,风险才能得到认真对待。著名计算机科学家斯图尔特·拉塞尔提出了这种恐惧的黑暗版本,问道:“我们是否需要一次‘切尔诺贝利级灾难’才能监管AI?”这种担忧我听到很多在该领域工作的人们反复提及。接下来会发生什么事情并不完全清楚,历史上,社会对警告信号的反应并不理想。这几乎肯定不会是最后一起事件, ongoing investigations may yet uncover more, or reveal more concerning details. What we already know, though, has exposed a fairly daunting list of
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡