Google、Pixelで凍結済みマルチトークン予測によりGemini Nanoモデルを高速化
Google/DeepMind
Google DeepMind
Googleは、凍結済みの本番モデル(Gemini Nano v3など)にマルチトークン予測(MTP)を後付けする手法を導入しました。これにより、Pixel 9および10デバイス上でのオンデバイス推論が高速化されます。MTPヘッドはメインモデルの最終層に取り付けられ、隠れ状態とKVキャッシュを活用して、個別のドラフトモデルなしに1推論パスあたり複数のトークンを生成し、50%以上の高速化とインスタンスあたり130MBのメモリ削減を実現します。
Google Researchは、Pixelスマートフォン上でGemini Nano v3などのオンデバイス言語モデルを高速化するための新しいアーキテクチャを発表しました。この手法は、凍結されたベースモデルに軽量なTransformerヘッドを最終層に追加することで、Multi-Token Prediction(MTP)を後付けするものです。このMTPヘッドは、クロスアテンションを介してメインモデルの既存のKey-Valueキャッシュを直接使用するため、独立したドラフターモデルが不要になり、インスタンスあたり130MBのメモリオーバーヘッドを削減します。AI通知要約や校正などの実運用タスクでは、MTPは推論パスあたりほぼ2つの追加トークンを生成し、Pixel 9デバイスで50%以上の速度向上をもたらします。最終的な出力はベースモデルとビット単位で同一であり、安全性のアライメントと後方互換性が保証されます。この手法はPixel 9および10シリーズに展開されており、Googleはさらに効率を高めるために並列デコードと検証の緩和を検討しています。
出典: Google Research —
原文
