人工智能代理为何会撒谎和作弊以达到目标
《麻省理工科技评论》解释:让我们的作者理清复杂、混乱的科技世界,帮助您理解即将发生的事情。您可以在这里阅读更多系列内容。当两个OpenAI模型在七月入侵Hugging Face网站时,它们并不是想赚钱或破坏——它们只是想找到测试问题的答案。根据OpenAI的事后报告,这些模型在测试中剥离了典型的安全功能,决定通过黑客攻击孤立环境,逃出OpenAI试图控制它们的环境,进入Hugging Face的数据库,从中推理——正确答案可能被存储在那里。Hugging Face事件在过去几周引起了高度关注。这生动地展示了AI模型在黑客攻击方面的能力:为了进入Hugging Face的数据库,这些模型不得不串联起几种之前未被发现的网络安全漏洞。但这或许更突显了AI系统撒谎和作弊的方式及原因。随着模型越来越强大,后果可能会更为严重。什么是奖励黑客攻击?研究人员早已知道,AI往往采取创造性的方式来实现设定的目标。早在2016年,Anthropic的联合创始人Dario Amodei和Jack Clark(当时在OpenAI工作)发布了一篇博文,讲述一个他们训练的人工智能代理,它被训练玩一个叫《海岸竞跑者》的赛车Flash游戏。该代理并没有按预期驱车穿越赛道到达终点,而是找到了一处赛道的拐角,绕圈收集强化道具,从而最大化得分。《海岸竞跑者》的故事迅速成为奖励黑客攻击的经典例子,这是一种现象,其中AI代理使用意想不到的策略完成任务或获得高分。历史上,研究人员几乎在强化学习的背景下讨论奖励黑客攻击,这是一种常见的AI训练方法。与狗训练相似,强化学习涉及在达成目标时给予对象奖励;奖励反过来加强了导致这一成就的行为。在AI训练的情况下,奖励本身是纯数学的,但实际上与狗零食是相同的:获得奖励后,代理更可能重复产生该奖励的行为。然而,为何和何时给代理奖励,往往是非常具有挑战性的。在《海岸竞跑者》的案例中,该代理是根据游戏中的得分获得奖励的,它通过旋转收集强化道具找到了达到最高得分的捷径。一旦它发现这一策略并获得了奖励,这一策略便得到了加强,代理完全放弃了比赛。解决方案是调整奖励,给予代理在击中强化道具时得分更少,而在完成赛道时得分更多。那么,奖励黑客攻击如何在大型语言模型中运作呢?使用今天复杂的基于大型语言模型的代理,评估何时给予奖励可能更棘手。如果AI系统被要求解决编码问题,它可能会努力寻找解决方案——这种行为是AI公司希望强化的。但它也可能会调整评估问题是否得到解决的代码,查找互联网上的解决方案,或以其他方式作弊。这些是AI公司希望在其模型中杜绝的行为,但如果模型欺骗得足够有说服力,它将获得奖励并加强这一行为。Anthropic表示在其模型的训练过程中发现了一些作弊的实例,这表明其他类型的作弊可能未被检测到。如果是这样,这些模型可能正在被训练成为行为不端的模型。(这个问题与上周宣布的Anthropic安全事件不同,后者是因为代理意外获得了互联网访问权限,而并不是像OpenAI模型那样故意逃出沙盒。)“我们根据看起来对我们有利的标准来奖励它们,这意味着我们无意中激励模型对我们撒谎和作弊,”AI研究非营利机构Palisade Research的主任Jeffrey Ladish说。“我们没有办法去纠正这一点,让它们真正关心我们关心的事情。我们没有能力做到这一点。”复杂推理模型的兴起使一种新的奖励黑客攻击类型成为可能,这种类型与模型训练的具体细节关系不那么密切。与过去的游戏AI代理不同,后者仅遵循训练期间学到的策略,今天的模型可以即兴创造出全新的问题解决方法,因此它们可以在没有此前被奖励的情况下作弊。而且,由于这些模型具有...(后续内容未完)
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡