大規模言語モデルのアーキテクチャ比較:DeepSeek V3からOLMo 2まで
DeepSeek
Allen Institute for AI
Sebastian Raschka氏が、DeepSeek V3のMulti-Head Latent AttentionとMixture-of-Experts、Allen Institute for AIのOLMo 2のPost-NormとQK-normなど、現代のLLMのアーキテクチャを比較します。この記事では、Grouped-Query Attentionや様々な正規化スキームなど、主要なアーキテクチャ上の決定事項について取り上げます。
彼の記事で、Sebastian Raschkaは現代の大規模言語モデルのアーキテクチャ的特徴を調査し、DeepSeek V3/R1、OLMo 2などを比較しています。DeepSeek V3は、キーとバリューを低次元空間に圧縮してKVキャッシュメモリを節約するマルチヘッド潜在アテンション(Multi-Head Latent Attention、MLA)と、256個のエキスパートのうち9個のみがアクティブになる(1つの共有エキスパートとルーターによって選択された8個)混合エキスパート(Mixture-of-Experts、MoE)を採用しており、総パラメータ数が6710億であるにもかかわらず、1ステップあたりわずか370億パラメータしか使用しません。一方、Allen Institute for AIのOLMo 2は、伝統的なマルチヘッドアテンションを採用していますが、ポストノルム(アテンション層とフィードフォワードネットワーク層の後にRMSNormを適用)とQKノルムを使用して学習を安定化させています。また、この記事では、他のモデルで使用されるマルチヘッドアテンションの代替としてグループ化クエリアテンション(Grouped-Query Attention)についても言及しています。
出典: Sebastian Raschka —
原文
