返回

文章详情

连续扩散语言模型 (CDLM's)

Hacker News2026年8月30日 20:46

近年来,连续扩散模型在语言领域的活动热潮表明,这种方法正在逐渐复苏。完全离散的扩散方法在很大程度上取代了早期的连续扩散尝试,但潮流开始转变。在这篇文章中,我想更仔细地看看发生了什么,以及为什么现在会这样。最近在这一领域新研究的涌入激励我写下我的一些想法。我之前曾写过关于扩散语言模型的内容,因此这主要是一次更新,涵盖自那时以来发生的一切。这将是一个相当主观的叙述——其他观点和不同意见非常欢迎在评论区和其他地方提出!稍后我将讨论一些连续扩散在语言中的技术方面,但首先,提供一些历史背景。挑战自回归霸权 现代语言模型在很大程度上是自回归的:它们一次生成一个标记序列。这是将一个困难生成任务自然分解为更小、更易于顺序执行的步骤。这些步骤都是同一基础任务的实例(预测一个标记给定前面的标记),这使得在序列维度上可以共享参数。尽管这种生成过程本质上是顺序的,但Transformer架构允许在所有序列位置高效并行训练,使用教师强制。事实证明这是一种极具可扩展性的方案,这为我们带来了大型语言模型(LLMs)。然而,自回归并不是构建序列迭代生成过程的唯一方法。在早期音视频领域的成功启发下,研究人员寻求将扩散应用于语言生成,而不是一次生成一个元素。扩散模型的生成过程定义为逆转一个逐渐破坏信息的腐蚀过程。实现这一点的典型方法是逐渐添加高斯噪声,直到其完全压制信号。 2021年:早期离散扩散模型 在2019年和2020年的图像生成方面取得早期成功后,2021年首次出现将这一理念应用于语言的尝试,涉及将连续腐蚀过程替换为离散过程,以便对分类数据进行建模:多项分布扩散、D3PM和SUNDAE。那时,自回归的主导地位并没有今天那么牢固:GPT-3引起了一些关注,但“ChatGPT时刻”要到2022年底才会到来。那时,离散扩散似乎解决了自回归范式中的一些真实理论缺陷,如由于教师强制造成的暴露偏差以及它用于填充和受限生成任务的相对困难。注意,前几年曾有一些探索非自回归和任何阶自回归方法的工作,但从未从扩散的角度出发。 2022年:用于离散数据的连续扩散 在2022年,几种将连续扩散应用于语言建模的尝试出现了,从Diffusion-LM开始。这种方法通过将离散类别表示为连续嵌入向量来解决分类数据与高斯噪声腐蚀之间的不兼容性,而这些嵌入向量完全适合高斯噪声的腐蚀。通过这种方式,可以在没有任何变化的情况下应用对于图像效果良好的高斯扩散机制。Diffusion-LM特别宣传了这种替代生成范式在可控文本生成方面的优势。在2022年最后几个月,发布了许多采用该方法变体的论文,包括DiffuSeq、SSD-LM、Difformer、SeqDiffuSeq、GENIE、LD4LG以及我参与的两篇论文:自条件嵌入扩散(SED)和分类数据的连续扩散(CDCD)。那时,这些连续方法的吸引力在于它们可以受益于所有在连续扩散中发现和开发的见解、工具和机制,因为这些方法完全主导了音视频生成。例如,将为连续扩散模型开发的一些采样和蒸馏技术应用于离散扩散通常要简单得多,甚至是不可能的。 2023年底:连续方法的消亡 然后,发生了一些有趣的事情:在2023年之后,几乎所有新研究都使用离散扩散,语言的连续扩散几乎消亡。2025年一篇关于扩散语言模型的调查论文中的一张图表清楚地显示了这一点:—— Sander Dieleman (@sedielem) 2025年8月19日。连续方法标记为黄色,离散方法标记为绿色。2023年到2024年的过渡是

赞助内容

NordVPN Next-gen Antivirus

本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。

请我喝杯咖啡