⚡ 速報
LLMアーキテクチャの革新:KV共有、レイヤーごとの埋め込み、圧縮注意機構
Google/DeepMind
Poolside
DeepSeek
Technology Innovation Institute
Sebastian Raschka氏が、長文コンテキスト効率に焦点を当てた最近のオープンウェイトLLMアーキテクチャの進歩をレビュー。主要な技術には、レイヤー間のKV共有(Gemma 4)、レイヤーごとの埋め込み(Gemma 4 E2B/E4B)、レイヤー単位のアテンションバジェッティング(Laguna XS.2)、圧縮畳み込み注意機構(ZAYA1)、および圧縮注意機構を用いたmHC(DeepSeek V4)が含まれる。これらは、推論やエージェントワークフローにおけるKVキャッシュサイズとメモリトラフィックを削減する。
Sebastian Raschkaが、長いコンテキストのコストを削減することを目的とした最近のオープンウェイトLLMのアーキテクチャ変更を調査しています。Gemma 4 E2B/E4Bでは、後続の層が先行の層のキー・バリュー状態を再利用する(クロスレイヤーアテンション)ことで、KVキャッシュサイズを約半分に削減しています(例えば、128Kコンテキストで2.7GB)。さらに、これらのモデルは層ごとの埋め込み(PLE)を使用して、メインのトランスフォーマースタックを拡張せずに容量を増やしています。これにより、埋め込みを含むパラメータ総数よりも「実効」パラメータ数が小さくなっています。PoolsideのLaguna XS.2は層ごとにアテンションコストを変えており、30のスライディングウィンドウ(ウィンドウサイズ512)層と10のフルアテンション層を採用しています。ZAYA1-8Bは圧縮畳み込みアテンションを導入し、DeepSeek V4はmHCと圧縮アテンションを採用しています。これらの調整は、推論モデルやエージェントワークフローにおいて、効率的な長文脈処理のニーズが高まっていることに動機づけられています。
出典: Sebastian Raschka —
原文
