現代の大規模言語モデルにおける注意機構のバリエーション:ビジュアルガイド
OpenAI
Allen Institute for AI
Meta
Alibaba/Qwen
Google/DeepMind
Mistral
Hugging Face
Cohere
本記事では、現代の大規模言語モデルにおける注意機構を視覚的に解説。標準的なマルチヘッド注意機構(Multi-Head Attention, MHA)から、グループ化クエリ注意機構(Grouped-Query Attention, GQA)、マルチヘッド潜在注意機構(Multi-Head Latent Attention, MLA)、スパース注意機構、そしてハイブリッドアーキテクチャまでを網羅。45項目のLLMアーキテクチャギャラリーとポスターバージョンも付属。
Sebastian Raschka氏が、現代のLLMにおける注意機構のバリエーションに関するビジュアルガイドを公開し、45のLLMアーキテクチャのギャラリーも併せて発表した。この記事では、マルチヘッドアテンション(multi-head attention, MHA)とその歴史的背景、そしてキー・バリューヘッドを共有することでKVキャッシュコストを削減するグループ化クエリアテンション(grouped-query attention, GQA)について取り上げている。GQAは効率と品質の間で人気のあるトレードオフである。DeepSeek V3で採用されているマルチヘッド潜在アテンション(multi-head latent attention, MLA)は、キャッシュをより積極的に圧縮しながらも、優れた性能を維持する。また、スパースアテンションやハイブリッドアーキテクチャについても議論し、各バリエーションのモデル例を紹介している。ポスターバージョンはRedbubbleで入手可能である。
出典: Sebastian Raschka —
原文
