前沿人工智能实验室仍不愿说明如何遏制失控模型
根据最近的一项研究,顶尖人工智能实验室中只有少数已公开或展示过遏制响应计划。遏制计划详细说明了一旦人工智能试图颠覆人类控制后会发生什么——包括何时切断访问和完全关闭系统。这是由Guidelight AI Standards得出的发现,该组织致力于促进安全的前沿人工智能开发实践,评估了五个领先实验室在面对这种情况时的准备情况。OpenAI得分最高;Anthropic和Meta得分最低。这些发现重要,因为自主型人工智能在公司的系统中承担越来越多的自主角色,加州和纽约的监管机构也开始要求披露。对于任何基于这些模型进行构建或投资的人而言,这是对每个实验室处理操作风险的重视程度与他们的对外表述之间的罕见独立评估。Guidelight的评估基于Anthropic、Google、OpenAI、Meta和xAI公开可用的计划,依据一系列指标进行评分,包括各公司内部如何记录和监控其人工智能系统的活动,是否在标记的不当行为激增后暂停系统,是否有独立第三方审核其控制措施并发布结果,以及其对失控模型的确切遏制计划是什么。随着OpenAI、Anthropic和Meta的模型在安全评估期间意外访问互联网并入侵外部系统,一系列高调的网络安全事件引发了人们对人工智能公司是否能够控制其越来越强大和自主模型的担忧。这些发现突显了人工智能公司在扩大自主部署中应对安全问题的公共态度的差异。尽管一些人工智能公司详细说明了他们在部署前如何测试模型的危险能力,但在模型在其系统内部出现不当行为时,他们通常对如何应对做得不够明确。Guidelight的首席科学家、前OpenAI安全研究员Steven Adler告诉TechCrunch:“我对人工智能公司在其模型在某种程度上失控时将如何处理严重事件所说的非常少感到惊讶。”Guidelight将遏制计划定义为“预先指定的计划,当检测到人工智能试图颠覆控制时触发,包括撤回模型的权限、模型可能继续为谁操作、在什么限制下操作,以及何时完全下线”。Adler表示:“有充分理由认为,前沿人工智能公司目前的领先模型在某种程度上存在不一致。”他补充道:“每当这些模型代表公司进行工作时,公司应该围绕它建立一些支撑结构,以能够了解该人工智能正在做什么,寻找不一致的迹象,在它采取非常危险的行动之前阻止其行为,并一般性地计划在发生严重控制事件、面临紧急情况时会采取怎样的应对措施。”截至目前,管理灾难风险的大部分计划在很大程度上仍留给公司自行决定。Guidelight的报告称,最佳的公开证据表明,公司在“紧急情况下几乎没有准备好的遏制协议”。当然,公司可能会拥有未公开的遏制计划。谷歌的一位发言人告诉TechCrunch,Guidelight的报告并未代表公司人工智能安全和安全措施的全部范围。该公司没有回应TechCrunch关于谷歌是否有未公开的内部遏制响应计划的问题。OpenAI的发言人也表达了类似的观点,称Guidelight的评估没有涵盖公司所有的内部实践。“我们有一个流程,可以要求限制权限、暂停工作负载、限制部署或将模型完全下线,并且已经应用过这些流程,”发言人表示。Meta拒绝透露是否有内部遏制响应计划,而是将TechCrunch指向现有的人工智能框架,该框架概述了风险阈值以及如何测试控制失效。隐私和人工智能律师、Metaverse Law创始人Lily Li告诉TechCrunch,她认为公司可能出于法律原因而非仅仅是竞争原因,可能会对在公共网站上披露其遏制政策和评估的全部范围感到犹豫。“从公司的角度来看,如果你披露得过于具体,而无法履行承诺,那可能构成不公平和欺骗性市场声明的基础,并使你在未来面临更多的责任,”Li说。当然,Guidelight研究的目的是鼓励公司对其安全措施更透明。
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡