控制大型语言模型中的推理努力
自从OpenAI发布o1模型,推广了基于大型语言模型(LLMs)推理模型的概念,已经快两年了。大约四个月后,DeepSeek-R1随之推出,并附带了可验证奖励的强化学习(RLVR)食谱的详细信息,用于训练这样的推理模型。上周,OpenAI发布了GPT-5.6模型系列,提供三种尺寸,每种尺寸大约有五到六个推理努力设置。图1:不同推理努力设置的GPT 5.6 Sol模型。(Ultra的基准数字目前不可用,但应该与Max相对相似,因为它使用了相似的努力水平,但通过四个子代理加速了工作。)所以,是的,推理模型会继续存在。它们已成为现代模型发布的标准部分。过去,我曾报道过推理模型的方法论(理解推理LLMs)以及相关的研究论文(大型语言模型推理的强化学习现状和大型语言模型推理模型推断的现状)。我甚至写了一本关于如何开发推理模型的新书,《从头开始构建推理模型》。这些资源专注于将传统的LLM转变为推理模型。现在,在本文中,我想重点讲解如何开发具有多种努力模式的推理模型,类似于本文开头图示所示的内容。不用担心,本文章可以作为独立的文章阅读。然而,上述资源可能会很有趣并且有用。谈到几乎任何机器学习或AI技术或子领域,一个教训是我们通常不应“字面”理解技术术语。例如,机器学习和AI中的(人工)神经网络并不字面意义上像人类大脑那样运作的生物神经网络。类似地,当谈到“推理模型”时,我们不应期待这些模型像我们人类那样字面推理。在AI和LLM研究的背景下,“推理模型”指的是一种输出中间推理痕迹的模型,这就像是逐步处理问题或任务的中间响应。通过展示一个例子,可能最容易解释这一点。图3:常规LLM答案(左)和推理模型答案(右)的示意图。基本上,有两种方法来提高(推理)任务性能:训练规模和推理规模。图4:训练和推理规模是提高LLM和推理模型问题解决能力的两种方法。图基于学习使用LLMs进行推理。让我们先简要谈谈训练。简而言之,DeepSeek-R1提出使用可验证奖励的强化学习(RLVR)来训练LLM,将其转变为推理模型。RLVR是一种为可验证数据领域提供奖励信号(0=不正确和1=正确)的技术。这些可验证的数据领域包括数学(我们可以使用符号数学检查器如SymPy或WolframAlpha来检查结果)和代码(我们可以使用编译器或单元测试,或像LeetCode这样的集成平台)来检查正确性。图5:在RLVR训练期间的准确性和格式奖励的示意图。值得注意的是,推理痕迹本身并未被用于训练或更新模型。尽管他们尝试使用中间响应信息进行训练,但DeepSeek-R1论文报告称,对模型训练没有帮助,因此最终未被使用。(通过过程奖励模型将中间推理痕迹纳入训练信号的方式及其有效性是一个活跃的研究领域。)图6:在RLVR期间,中间推理痕迹被忽略;只有最终答案和响应格式决定奖励。无论如何,仅仅根据输出奖励进行训练,正如图7所示,结果证明足以让模型学会如何推理,通过问题,这意味着它会学习写出中间解释、回溯并自我纠正。当模型意识到自己犯了错误并自我纠正时,这些时刻被称为“恍然大悟”时刻。图7:一个恍然大悟的时刻示例,其中推理模型发现其中间推理中的错误,并在产生最终答案之前纠正它。顺便说一下,虽然DeepSeek-R1毫无疑问是更受欢迎的论文,并且引起了关于可验证奖励的强化学习和推理模型开发的兴奋,但还有另一篇论文Kimi K1.5,正好在arXiv上于同一天发布(2025年1月22日)。此外,RLVR这个术语早在两个月前就已在《Tülu 3: 推动开放语言模型后训练的前沿》一书中提出。DeepSeek-R1成为更受欢迎论文的一个原因是它展示了可以通过纯强化学习(RL)实现推理行为。图8:DeepSeek-R1-Zero直接将RLVR应用于预训练基础模型,而无需监督微调。
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡