DiffusionGemma:将文本生成速度提升高达4倍
Google/DeepMind
DeepMind
NVIDIA
Google DeepMind 推出了 DiffusionGemma,一款基于文本扩散的实验性开放模型。该模型能同时生成整个文本块,与自回归大语言模型相比,速度提升高达4倍,专为处理本地、延迟敏感场景的研究人员和开发者设计。
Google DeepMind 发布了 DiffusionGemma——一款采用文本扩散生成技术的实验性开源模型(Apache 2.0 许可)。与传统自回归大语言模型(Large Language Model, LLM)依次处理 token 的方式不同,DiffusionGemma 能够同时生成整块文本,在 GPU 上实现最高 4 倍的加速(在单块 NVIDIA H100 上超过 1000 token/秒,在 NVIDIA GeForce RTX 5090 上超过 700 token/秒)。该模型采用专家混合(Mixture of Experts, MoE)架构,拥有 260 亿参数,但推理时仅激活 38 亿参数,量化后可在 18 GB 显存内运行。主要特点包括:双向注意力(每轮 256 个 token)、迭代自纠正,以及专注于非顺序任务(如代码编辑、填充空白或处理氨基酸序列)。然而,其输出质量低于标准 Gemma 4;若开发者追求最高精度,建议使用自回归版本。DiffusionGemma 在低并发本地推理场景中尤其高效;在高吞吐量云环境中,加速优势有所减弱。该模型现已可在 Hugging Face 上下载,并支持 MLX、vLLM、Hugging Face Transformers;未来计划集成 llama.cpp。DeepMind 与 NVIDIA 合作,针对消费级和企业级 GPU(包括 GeForce RTX 5090/4090、Hopper、Blackwell、NVIDIA DGX Spark、DGX Station、RTX PRO)进行了优化;支持 4 位 NVFP4 格式以进一步提升速度。此外,还发布了开发者指南、视觉辅助资料以及使用 Hackable Diffusion(JAX)进行微调的教程。
来源: Google DeepMind —
原文
