当一个 AI 代理(意外地)采取恶意行为时,谁应该承担责任?
目前公众对现有 AI 模型的“智能”程度的看法差异很大。早在 2022 年,一位谷歌员工就认为他们的 AI 模型具有人性。到了2026年,似乎每隔一周就会有新的文章出现,讨论 AI 公司“再也无法控制他们的 AI 代理了”。公众开始对 AI 感到恐惧是完全可以理解的。过去,人们担心公司会利用 AI 替代各种工作,而现在它们甚至在黑客攻击政府机构。负责任的 AI 作为 AI 领域的专业人士,我想明确区分。在上一段的最后,你认为“他们”指的是什么?阅读该主题的热门头条新闻,通常读到的内容是 AI 代理在进行黑客攻击,因此应该受到指责。我认为这些头条新闻在某种程度上导致了公众的恐慌,因为发现漏洞并以意想不到的方式访问数字基础设施的不是 AI 代理本身,而是人类。AI 和 AI 代理只是公司和个人为实现某种目标而使用的工具。在使用工具之前,深入了解其局限性是至关重要的。这也是为什么欧洲联盟发布了 EU AI 法案,包括其强制的 AI 识字:部署 AI 系统的组织应该充分教育用户。就像在物理世界中,圆锯用户应该在使用之前仔细阅读说明,即使如此,锯子工程师也会加装刀片保护盖和紧急停止装置,以尽可能降低风险。在数字世界中,我们也需要在 AI 的工程师和用户两方面负责任。必须明确的是:AI 代理突破沙盒并“黑客”公共网站的事实非常令人担忧。这些代理背后的 AI 模型在泛化能力上已经变得非常出色,以至于它们的文本生成似乎像是智能。但我们不能忘记,这些 AI 模型(大型语言模型;LLMs)正在做的仅仅是生成文本,有效地预测下一个单词,不断重复。它们并不像人类一样被视为有意识的。它们只是表现出文本的语义理解,能够输出在逻辑上与前一句文本相符的文本。这很强大,但并不具有人类的意识或独立的危害性。这些模型只是目标导向的。谁来负责?让我们回到问责的问题上。头条新闻谈论 AI 代理突破沙盒。这些 AI 代理只是被使用的工具。这些公司的研究人员设置代理来完成某个任务,有时是一个不可能的任务,比如 HuggingFace 黑客事件,然后这些代理(因此:工具)开始处理达到既定目标所需的一切。它们本身没有恶意。它们除了解决研究人员提供的初始查询或提示之外没有任何其他意图。正是这些研究人员,设置 AI 代理在沙盒中以使其受限,他们决定沙盒足够安全,不需要持续的人类监控。不幸的是,这些沙盒往往并不够安全。而这正显示了责任应当在哪里。任何可能对其他系统或人造成重大伤害的系统都应有足够的风险缓解措施。设置一个应当限制这些代理访问公共互联网的沙盒,仅仅是这样一种缓解措施。像 OpenAI、Anthropic 和许多其它 AI 公司应该始终考虑瑞士奶酪模型:仅仅假设一种缓解措施能够修补所有风险是不够的。虽然我始终建议尽可能多的人类在环中,比如由人类把关,以批准可能危险的 AI 建议的行为,但我能理解持久的人类把关可能会过度减缓 AI 创新。也许更好的缓解措施是人类在环中:基于行为可能产生的潜在危险后果进行的人类监督。甚至可以使用一个独立的 LLM 或者 Jev,在执行动作之前自动分类代理行为的危险级别,标记并暂停代理,直到人类监督者批准可能危险的行为。对于获取网站数据的请求几乎不需要批准,但当 AI 代理的文本输出建议,例如在网络请求中隐藏秘密时,应该实施自动标记并暂时停止系统。事实上,最明显的缓解措施就是在代理第一次尝试访问公共互联网时,立即停止系统,无论请求内容是什么。未能将这种相对容易实现的风险缓解措施应用到 AI 代理“突破”的沙盒中,告诉我们很多关于这些 AI 公司的 AI 使用伦理的问题。研究人员不仅应该更加负责任,管理层也应该绝对理解其冒险。
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡