標準LLMを超えて:線形注意ハイブリッド、テキスト拡散、コードワールドモデル、そして小型再帰型トランスフォーマー
Moonshot AI
MiniMax
Alibaba/Qwen
DeepSeek
Google/DeepMind
Mistral
Meta
Hugging Face
Sebastian Raschkaの記事では、標準的な自己回帰型トランスフォーマーLLMの代替技術として、線形注意ハイブリッド(例:MiniMax-M1、Qwen3-Next、DeepSeek V3.2、Kimi Linear)、テキスト拡散モデル、コードワールドモデル、小型再帰型トランスフォーマーを探求しています。線形注意メカニズムの復活と課題について議論し、例えばMiniMaxは推論タスクの性能低下によりM2モデルで標準注意に戻したことを挙げています。
Sebastian Raschkaが、マルチヘッドアテンションに基づく標準的な自己回帰型デコーダ方式トランスフォーマーの代替案について議論しています。注目すべきモデルとして、ライトニングアテンションを採用したMiniMax-M1、Gated DeltaNetとGated Attentionを採用したQwen3-Next、スパースアテンションを採用したDeepSeek V3.2、そしてKimi Linearが挙げられています。ただし、MiniMaxはM2モデルでは通常のアテンションに戻しており、その理由として推論やマルチターンタスクにおける精度の低さを挙げています。Qwen3-NextとKimi Linearは、リニアアテンション(Gated DeltaNet)とフルアテンション(Gated Attention)を3対1の比率で使用しています。Gated DeltaNetはMamba2とデルタルールを組み合わせてリカレント状態の更新を行います。この記事では、テキスト拡散モデル、コードワールドモデル、小規模なリカレントトランスフォーマーなどの他の代替案についても言及されていますが、詳細は述べられていません。
出典: Sebastian Raschka —
原文
