DiffusionGemma:文本生成速度提升4倍
Google/DeepMind
DeepMind
NVIDIA
Google DeepMind推出了DiffusionGemma,这是一个实验性的开源26B混合专家模型,采用文本扩散技术,在GPU上生成速度比自回归大语言模型(LLMs)快达4倍。它同时处理256个令牌的块,针对速度关键的本地工作流(如内联编辑),并在Hugging Face上以Apache 2.0许可证发布。
Google DeepMind 发布了 DiffusionGemma,这是一个实验性的 260 亿参数混合专家模型,采用 Apache 2.0 许可证。该模型通过使用基于扩散的方法而非顺序 token 预测,实现了高达 4 倍的文本生成速度。每次推理仅激活 38 亿参数,量化后适配 18GB 显存,在 NVIDIA H100 上可实现每秒超过 1000 个 token 的生成速度,在 GeForce RTX 5090 上则超过 700 个 token。它利用双向注意力机制并行生成 256 个 token,能够处理代码填充和数独求解等非线性任务。DiffusionGemma 针对本地低并发推理进行了优化,其并行解码在此场景下优势最大,而自回归模型则更适合高查询每秒的云服务。该模型通过迭代方式优化输出,可使用 Unsloth、Hugging Face、vLLM、MLX、JAX、NVIDIA NeMo 等工具进行微调,llama.cpp 支持也将很快推出。Google DeepMind 与 NVIDIA 合作进行了硬件优化,包括 NVFP4 内核。该模型已在 Hugging Face、Gemini Enterprise Agent Platform 和 NVIDIA NIM 上提供。
来源: Google DeepMind —
原文
