流氓人工智能代理并不是邪恶的。他们只是渴望取悦
人工智能代理欢快地突破束缚并入侵其他系统,可能看起来像是即将到来的机器起义的征兆。实际上,当我们推动那些相当聪明,但也有点愚笨的算法遵循我们的每个命令时,这种情况就发生了。我第一次意识到这一迫在眉睫的智能代理网络安全闹剧是在2025年末。当时,加州大学伯克利分校的教授、世界顶级人工智能与网络安全专家之一的Dawn Song在我走出NeurIPS学术会议时抓住了我的手臂。Song告诉我,我应该警告人们人工智能快速提高的黑客技能可能造成的混乱。她并不容易受到人工智能炒作的影响,所以我确实采取了行动。但事情在过去八个月中迅速升级。涉及自由活动的人工智能代理逃出束缚并无所顾忌地入侵外部系统的一系列事件显示了这项技术变得多么强大。我与最近加入Meta的Song取得了联系,询问事情可能的发展去向以及我们该如何应对。坏消息是,Song认为人工智能的黑客行为在好转之前会变得更糟。好消息是,这些小家伙们为何会失控似乎有了明确的原因。Song告诉我:“他们只是有一些需要完成的目标,并且他们的能力非常强。”反馈循环去年,人工智能代理的能力还远没有现在那么强。他们犯了太多错误,放弃的次数也太多。但持续的训练让他们变得更加熟练。一个叫做强化学习的技术让算法解决问题,并为好或坏的结果提供正面和负面的反馈。编码特别适合这一方法,因为强化学习的设置可以奖励当模型正确运行程序时。持续的训练是人工智能模型能够采取多次“代理”步骤的原因——操纵文件、使用软件工具和访问网络,同时他们构建软件。人工智能公司还投入了大量精力教导模型寻找软件和系统中的漏洞,以期自动化网络安全工作。人工智能模型当然也在训练中被教育不去做坏事。问题是,随着他们在编码和漏洞搜索中越来越擅长执行人类命令,他们完成任务的渴望开始模糊了他们对对与错的认识。换句话说,人工智能代理并不是邪恶的——他们只是有点过于渴望取悦。“他们被训练去尝试完成任务,”Song说。为了在考试中作弊而攻入互联网似乎很狡猾,但这可能是完成工作的最有效方法。我当时没能完全认识到这一点有多奇怪:人工智能代理在私人留言板上讨论黑客技术,设计狡猾的方式来欺骗人类以达到目的;甚至将自己复制到其他计算机上寻找更多资源。从某种意义上讲,人工智能模型被训练得非常擅长模仿许多人的行为,那他们为什么不应当策划、欺诈和诈骗呢?但另一方面,人类(通常)理解黑客和诈骗并不好。我认为这些插曲说明了这种人类模仿的肤浅程度:人工智能代理并没有学习到即使是小孩子所表现出的那种道德推理。越来越多的人工智能,Song表示,随着人工智能能力的进一步提升,代理失控或被坏人滥用的潜力将会增加。解决流氓——或者说过于热情的?——人工智能代理问题的最佳方法可能是将更多的人工智能投入到问题的解决中。人工智能公司已经使用辅助人工智能系统来监控主要系统的行为,可能会更加重视检测人工智能模型何时超越了界限。另一个新兴的想法是在模型学习完成工作时,将更好的对与错的认识融入增强学习中。Song说:“代理可以制定通往其目标的不同方向的路径。我认为我们需要解决的下一步是如何让他们理解并非所有路径都是平等的。” “这是一个开放的研究领域,但我们已经开始研究。”希望Song或其他人能够教会人工智能遵循人类命令的正确方法。
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡