知識蒸留を大規模に実行できるほど低コストにする
Multiverse Computing
NVIDIA
Meta
Multiverse Computingによる新しい論文では、キャッシュされたトップKロジットと融合チャンク化KL損失を用いた効率的なオフライン知識蒸留を紹介しており、VRAM使用量を15倍以上削減し、単一GPUでの長文脈蒸留を可能にしています。この技術によりトレーニングコストが大幅に削減され、大規模な蒸留実験が実用的になります。
知識蒸留(ナレッジ・ディスティレーション)は、より小さな生徒モデルが大きな教師モデルに一致するように学習させる手法で、大規模言語モデル(LLM)を圧縮するための標準的なテクニックです。最近のオープンソースLLM、例えば2.8兆パラメータを持つKimi-K3は約3TBのVRAMを必要とするため、圧縮が不可欠です。論文「Efficient Knowledge Distillation for LLMs: Offline Top-K Logits and a Fused Chunked KL Loss」は、教師モデルのtop-Kロジットをオフラインでキャッシュすることで蒸留の高コストに対処し、教師をメモリに保持する必要性を排除します。また、フューズド・チャンクKL損失を導入し、損失をチャンク単位で計算することで、語彙×シーケンスの全体行列を回避します。これにより、単一のH200でのピークVRAMが250GBから128GBに削減され、1つのGPUで32Kコンテキストの蒸留が可能になり、4ノードではなくなり、ステップ時間が5倍高速化されます。Llama 3.1 8B Instructから3.2Bパラメータに蒸留された生徒モデルは、BoolQやHellaSwagなどのベンチマークでほとんどの精度を維持し、MMLUでは9ポイント以内に留まります。
出典: Hugging Face blog —
原文
