返回

文章详情

DiffusionGemma技术报告

Hacker News2026年8月20日 13:24

作者: DiffusionGemma团队: Adrien Ali Taïga, James Assiene, Daniele Calandriello, Rahma Chaabouni, João Gante, Tamara von Glehn, Nate Keating, Chris Knutsen, Martin Kukla, Tianlin Liu, Ivan Lobov, Ofir Nabati, João Gabriel Oliveira, Nicolas Perez-Nieves, Nastasia Prutianova, Bobak Shahriari, Jean Tarbouriech, Pavel Tyletski, Çağlar Ünlü, Cindy Wu, Glenn Cameron, Jerome Connor, Sertan Girgin, Maarten Grootendorst, Alon Levkovitch, Eliya Nachmani, Omar Sanseviero, Piotr Stanczyk, Quentin Berthet, Andrew Campbell, Clément Crepy, Valentin De Bortoli, Arnaud Doucet, Romuald Elie, Alexandre Galashov, Klaus Greff, Alexis Jacq, David Ruhe, Yu-Han Wu, Sebastian Flennerhag, Brendan O'Donoghue, George Scrivener, Shantanu Thakoor。 摘要: 我们介绍DiffusionGemma,这是一个实验性的开放权重语言模型,使用离散扩散以极高速度生成文本。DiffusionGemma以256个标记为一个块进行并行迭代改进,而不是一次解码一个标记,从而避免了传统自回归(AR)大型语言模型的顺序解码瓶颈。我们通过对激活3.8B和总参数25.2B的专家混合模型Gemma 4进行微调,而不是从头开始训练,得到了DiffusionGemma。我们的计算高效的两阶段训练管道使用的训练标记预算不到起始AR模型的10%。第一阶段使用监督微调来教授双向去噪,而第二阶段结合强化学习和采样器蒸馏共同提高生成质量和推理效率。DiffusionGemma建立了生成速度与模型能力之间的新帕累托前沿。在我们的全评估套件中,DiffusionGemma每次前向传递生成约20个标记,单个NVIDIA H100 GPU的输出速度约为1500个标记每秒,这比即使是最先进的投机解码的AR模型快得多。尽管进行了扩散微调,DiffusionGemma仍然能够进行AR生成,表现略有下降,暗示了混合扩散-AR解码的路径。 主题: 计算与语言 (cs.CL) ; 人工智能 (cs.AI) 引用格式: arXiv:2608.00146 [cs.CL](或arXiv:2608.00146v1 [cs.CL],此版本适用) https://doi.org/10.48550/arXiv.2608.00146 arXiv发布的DOI通过DataCite 提交历史 来自: Jean Tarbouriech [查看电子邮件] [v1] 2026年7月31日 星期五 16:11:46 UTC (6,116 KB)

赞助内容

NordVPN Next-gen Antivirus

本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。

请我喝杯咖啡