DiffusionGemma:テキスト生成が4倍高速に
Google/DeepMind
DeepMind
NVIDIA
Google DeepMindは、テキスト拡散を用いる実験的なオープンな26B Mixture of Expertsモデル「DiffusionGemma」を発表しました。GPU上で自己回帰型大規模言語モデルと比較して最大4倍高速に生成でき、256トークンのブロックを同時に処理します。インライン編集のような速度が重要なローカルワークフローを対象としており、Apache 2.0ライセンスでHugging Face上に公開されています。
Google DeepMindが実験的な260億パラメータのMixture of Experts (MoE)モデル「DiffusionGemma」をApache 2.0ライセンスで公開しました。このモデルは逐次的なトークン予測の代わりに拡散ベースの手法を用いることで、最大4倍高速なテキスト生成を実現します。推論ごとに活性化するパラメータはわずか38億で、量子化すれば18GBのVRAMに収まり、NVIDIA H100上で毎秒1000トークン以上、GeForce RTX 5090上で700トークン以上の速度を達成します。双方向注意機構(bidirectional attention)を利用して256トークンを並列生成し、コード補完や数独解決といった非線形タスクを可能にします。DiffusionGemmaは、並列復号(parallel decoding)が最大の効果を発揮するローカル・低同時実行推論に最適化されており、高QPSのクラウドサーバ用途では自己回帰モデルの方が依然として優れています。このモデルは出力を反復的に洗練し、Unsloth、Hugging Face、vLLM、MLX、JAX、NVIDIA NeMoなどのツールで微調整が可能で、近日中にllama.cppもサポート予定です。Google DeepMindはNVIDIAと協力し、NVFP4カーネルを含むハードウェア最適化を実施しました。モデルはHugging Face、Gemini Enterprise Agent Platform、NVIDIA NIMで利用できます。
出典: Google DeepMind —
原文
