返回

文章详情

如何构建扩散语言模型

Hacker News2026年8月30日 23:41

内容 概述扩散的掩码 从概率的角度理解掩码扩散 灵活长度生成的块扩散结构:编码器、解码器和编码-解码器 迭代改进和内置误差修正 通过蒸馏加速扩散采样 扩散使可控生成成为可能 后训练的扩散语言模型 生物和科学领域 基于扩散的大型语言模型 扩散是否是通向更智能模型的路径? 从扩展法则的角度看 引言:自回归与扩散语言模型 当今广泛使用的两类生成型人工智能算法。对于连续数据,如图像或视频,最先进的方法基于扩散模型。而对于离散数据,如文本或代码,标准方法则是自回归模型。本文探讨了离散数据的一种替代方案,建立在现代扩散范式之上。 主流语言模型是自回归的:它们一次生成一个标记,从左到右,每个标记都以之前的标记为条件。这种方法非常强大,但也有固有的限制: 无误差修正:一旦发出一个标记,就无法修改,因此早期的错误会逐渐累积。 生成速度慢:生成一个序列的步骤与标记的数量成正比,且自然不便于快速并行生成。 因果注意力:生成仅向后查看,从不看未来的上下文。 扩散模型采取不同的方法。它们不是一次生成一个标记,而是一次生成整个序列,从初始猜测开始,并在多个步骤中迭代改进。这开启了几个优势:生成可以使用更少或更多的步骤在速度和质量之间进行权衡,错误可以在过程中纠正,而且每一步都关注于双向上下文。 自回归 LLM 按照从左到右的顺序一次生成一个标记,耗费的步骤与标记数量相等(上图)。而扩散 LLM — 例如这里展示的 Gemma Diffusion — 则从一个粗略的完整草稿开始,并在几个回合中并行地改善每个位置(下图),在每一步重写整个序列,而不是仅发出一个标记。 插图来源:M. Grootendorst & Gemma Diffusion。 将扩散应用于语言长期以来是一个未解的问题。到了2024年,该领域达到了一个转折点,扩散模型在质量上与自回归模型竞争。到2026年,扩散 LLM 将成为现实,行业领先实验室发布了 Mercury 2(Inception Labs)、Gemma Diffusion(谷歌)和 Nemotron Diffusion(NVIDIA)。本文追溯了这些现代模型所依赖的思想和论文。 背景:高斯扩散 在引入语言扩散之前,我们从高斯扩散生成图像的简要概述开始。然后通过类比构建离散扩散。 通过迭代去噪生成的核心概念是去噪。扩散模型不是一次性绘制图像,而是一步步生成图像,从纯随机噪声开始,在每一步删除一点噪声,直到出现一个连贯的图像。通过许多小步骤生成图像被证明比一次性生成要简单得多,这使得扩散模型如此有效。 模型如何学习去噪?诀窍在于通过展示噪声逐渐转变为图像的示例来教它。扩散通过两个互补的过程实现这一点。首先,前向过程将干净的源图像逐步转化为纯噪声。其次,反向过程学习逆转这种转化,将纯噪声转回图像;它是在前向过程中生成的图像到噪声的轨迹上训练的。 前向过程 前向过程以干净的训练图像为起点,生成一系列逐渐变得噪声更大的图像,这些图像描绘了从干净数据到纯噪声的路径。为此,它在每一步中混入越来越多的随机高斯噪声,直到图像溶解成纯静态。这个步骤根本不需要学习 — 我们只是在添加噪声 — 但这极为有用,因为它制造了无尽的训练数据:图像转变为噪声的示例,以及反之亦然。 高斯扩散轨迹下的图像。从左到右,前向过程逐渐添加噪声,直到清晰的狗照片溶解为纯静态。这条轨迹将作为反向过程的训练数据。 反向过程 反向过程是实际学习发生的地方。我们训练模型通过反向跟随前向过程产生的步骤,将噪声转换为图像。高斯扩散的反向路径。从左到右,生成的反向过程被训练为反向再现来自前向过程的轨迹,从而开始于...

赞助内容

NordVPN Next-gen Antivirus

本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。

请我喝杯咖啡