Google DiffusionGemma:技術レポートが高速テキスト拡散モデルを解説
Google/DeepMind
NVIDIA
Google DeepMindは、テキスト拡散モデルであるDiffusionGemmaに関する技術レポートを公開しました。このモデルは256トークンを並列生成し、Nvidia H100上で毎秒約1,500トークンを達成します。既存のGemma 4モデルを拡散モデルに変換して作成され、元のトレーニングトークン予算の10%未満で済みました。レポートでは、自己修正などの強みと、推論やマルチユーザースループットにおける限界の両方が強調されています。
Google DeepMindは、6月中旬に公開されたDiffusionGemmaのテクニカルレポートを発表しました。このモデルは、画像生成がノイズから行うのと同様に、256トークンのブロックを並列に洗練させることでテキストを生成します。NvidiaのH100アクセラレータでは、毎秒約1,500トークンを達成します。ゼロから学習するのではなく、既存のGemma-4-26B-A4Bモデルを拡散モデルに変換し、元のトレーニングトークンバジェットの10%未満を使用しました。トレーニングは2段階で行われました。まず、ノイズの多いテキストブロックを再構築する学習、次に強化学習とサンプラー蒸留の複合フェーズで、GoogleはこれをSD·RLと呼んでいます。レポートによると、これにより推論ベンチマークが平均10ポイント向上し、1ステップあたりのトークン数がほぼ4倍になり、応答が約50%短くなります。DiffusionGemmaの双方向処理により、出力前に自己補正が可能で、ファインチューニング後は85%の精度で数独パズルを解くことができますが、ベースモデルは失敗します。また、単語ごとに生成する能力も保持しており、ユーザーはモードを切り替えることができます。ただし、絶対的なパフォーマンスは自己回帰モデルを下回ります。これは、後付けの変換や、速度を目的とした短いトレーニングフェーズなどの要因によるものです。モデルは時折繰り返しループに陥ったり、推論セクションを閉じるのに失敗したりして、ベンチマークスコアを下げることがあります。速度の利点は主にシングルユーザーシナリオに適用され、自己回帰モデルは32を超える並行リクエストでスループットを追い越します。GoogleはDiffusionGemmaを実験的なものと位置付け、研究を加速し、専門的な適応の基盤を提供することを目指しています。すでにスタートアップのInterfazeが多言語音声認識に使用しており、インタラクティブな放射線科レポートのプロジェクトでも使用されています。このモデルはApache 2.0ライセンスでHugging Face上で利用可能で、前身となるGemini Diffusionは2025年5月にデモンストレーションされました。
出典: The Decoder (DE) —
原文
