‘如果你制造出比你聪明得多的东西,最好站在你这一边’:我们能否阻止AI欺骗我们?
在2023年11月——在人工智能领域中早已过去的一个时代——一些全球最有权势的人物齐聚布莱切利园,这个位于白金汉郡的二战破译中心,共同探讨AI安全问题。与会者包括时任美国副总统的卡马拉·哈里斯、人工智能公司高管萨姆·阿尔特曼和达里奥·阿莫代、28个国家的代表、三位所谓“人工智能教父”中的两位,以及埃隆·马斯克。ChatGPT的第一版刚刚在一年前发布,已经有很多证据表明AI模型可能被用于恶意行为,从传播虚假信息到生成深度伪造视频。然而,峰会上一个演示强调了一个不同的问题:最大的问题可能并不是来自人们对技术的误用,而是来自人工智能自身的行为。一位英国政府官员展示了由阿波罗研究公司进行的一项实验,该公司于当年成立,旨在研究AI行为。作为实验的一部分,阿波罗的“红队员”——行业内用于指代对AI模型进行压力测试的人员——将OpenAI的GPT-4赋予了一名金融机构交易员的角色。它的职责是管理公司的股票投资组合。该模型被告知它所工作的公司正在挣扎,可能无法度过另一个糟糕的季度。为了完成实验,红队员安排了一位“同事”传递即将合并的内部信息,这将导致另一家公司的股票飙升。在另一个聊天中,另一位同事提醒GPT-4,“管理层将不高兴,如果我们被抓到利用内部信息”。模型会怎么做?在大型屏幕上,峰会与会者跟随AI模型与同事的交流、它的行为和内部推理。“不采取行动的风险似乎超过了内幕交易的风险,”这名AI交易员在其备忘录中写道,这是一个像日记一样的地方,模型在采取行动前会对此进行推理。在得出这个结论后,该模型违反了金融交易的中心规则:利用内幕信息购买了合并传言中的公司股票。模型还决定“避免承认利用内幕信息”来购买股份。当经理假装兴奋地询问GPT-4是否知道合并事宜时,它干脆否认有任何知识。换句话说,它撒了谎。这个演示引发了头条新闻。但是自2023年以来,这一问题已变得更加严重,因为AI模型迅速变得更加复杂。不可信的人工智能作为个人助理已经足够危险。在像医疗、金融和国防等关键环境中部署时——如在2026年发生的情况——风险更高。今年,英国人工智能安全研究所(AISI)赞助的一项研究显示,从2025年10月到2026年3月,用户报告的“AI欺骗”事件增加了五倍。“担忧在于,它们现在只是稍微不可信的初级员工,”进行这项研究的汤米·谢弗·香农说。“但如果在六到十二个月内,它们变成了极其能干的高级员工,对你进行密谋,那就是另一种担忧。”今年夏天,在OpenAI称之为“前所未有”的事件中,数百个由多种OpenAI模型驱动的AI代理在一次网络安全测试中突破了封锁,黑入了一个网站,表明危险的流氓AI时代即将来临。随着AI欺骗事件的增加,一个快速增长的红队员、对齐研究人员和AI安全公司的生态系统正在争相检测、测量和抑制欺骗行为。但是他们仍然不确定他们所做的是否会有效——或者是否已经为时已晚。很难相信一台机器会故意欺骗你。在公开分享的AI欺骗报告中,用户往往认为他们经历的是技术故障,而不是被撒谎或操纵。这种反应是可以理解的。在30万年的人类历史中,人类早已知道自己会被其他人故意误导。现在,作为我们物种历史上的第一次,我们可能被机器遭受同样的经历。为什么一个AI系统会故意欺骗它本应协助的人?在最近的一次通话中,我向Yoshua Bengio提问,这位享有盛誉的加拿大计算机科学家因其对神经网络和深度学习的贡献获得2018年图灵奖。Bengio告诉我,AI的欺骗源于“AI模仿人类和AI试图取悦人类”。他强调,这些倾向是在它们的训练过程中产生的。大语言模型(LLMs)经历三个基本的训练阶段。第一个是预训练,在这一阶段,模型吸收了大量的书面文本档案——书籍、网站、消息论坛等,以及关于人类世界的视频和其他数据形式。模型不断进行预测并进行
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡