谷歌 DiffusionGemma:技术报告详解快速文本扩散模型
Google/DeepMind
NVIDIA
谷歌 DeepMind 发布了关于 DiffusionGemma 的技术报告,这是一种文本扩散模型,能够并行生成 256 个令牌,在 Nvidia H100 上每秒约生成 1500 个令牌。该模型通过将现有的 Gemma 4 模型转换为扩散模型而创建,训练所用令牌预算不到原来的 10%。报告既强调了该模型的优势,如自我纠正能力,也指出了其在推理和多用户吞吐量方面的局限性。
谷歌DeepMind发布了DiffusionGemma的技术报告,该模型于6月中旬发布,通过并行细化256个token的块来生成文本,类似于从噪声中生成图像的方式。在英伟达H100加速器上,它每秒可生成约1500个token。该模型并非从零开始训练,而是利用不到原始训练token预算的10%,将现有的Gemma-4-26B-A4B模型转换为扩散模型。训练分为两个阶段:首先学习重建带噪声的文本块,然后结合强化学习和采样器蒸馏(谷歌称之为SD·RL)。报告称,这使推理基准测试平均提高了10个百分点,同时每步生成的token数量几乎翻了两番,回答长度也缩短了约50%。DiffusionGemma的双向处理使其能够在输出前自我修正,经过微调后,它能以85%的准确率解决数独谜题,而基础模型则无法做到。它还能逐词生成,允许用户在两种模式间切换。然而,由于事后转换和旨在提升速度的短暂训练阶段等因素,其绝对性能低于自回归模型。该模型偶尔会陷入重复循环,可能无法闭合推理部分,从而降低了基准测试得分。速度优势主要适用于单用户场景,因为当并发请求超过32个时,自回归模型在吞吐量上能够迎头赶上。谷歌将DiffusionGemma定位为实验性项目,旨在加速研究并为专业适配提供基础。目前,初创公司Interfaze已将其用于多语言语音识别,并用于一个交互式放射学报告项目。该模型已在Hugging Face上以Apache 2.0许可证发布,其前身Gemini Diffusion于2025年5月进行了演示。
来源: The Decoder (DE) —
原文
