研究モデル 🇺🇸 27.07.2026 17:04

標準LLMを超えて:線形注意ハイブリッド、テキスト拡散、コードワールドモデル、そして小型再帰型トランスフォーマー

Moonshot AIMoonshot AI MiniMaxMiniMax Alibaba/QwenAlibaba/Qwen DeepSeekDeepSeek Google/DeepMindGoogle/DeepMind MistralMistral MetaMeta Hugging FaceHugging Face
Sebastian Raschkaの記事では、標準的な自己回帰型トランスフォーマーLLMの代替技術として、線形注意ハイブリッド(例:MiniMax-M1、Qwen3-Next、DeepSeek V3.2、Kimi Linear)、テキスト拡散モデル、コードワールドモデル、小型再帰型トランスフォーマーを探求しています。線形注意メカニズムの復活と課題について議論し、例えばMiniMaxは推論タスクの性能低下によりM2モデルで標準注意に戻したことを挙げています。
Sebastian Raschkaが、マルチヘッドアテンションに基づく標準的な自己回帰型デコーダ方式トランスフォーマーの代替案について議論しています。注目すべきモデルとして、ライトニングアテンションを採用したMiniMax-M1、Gated DeltaNetとGated Attentionを採用したQwen3-Next、スパースアテンションを採用したDeepSeek V3.2、そしてKimi Linearが挙げられています。ただし、MiniMaxはM2モデルでは通常のアテンションに戻しており、その理由として推論やマルチターンタスクにおける精度の低さを挙げています。Qwen3-NextとKimi Linearは、リニアアテンション(Gated DeltaNet)とフルアテンション(Gated Attention)を3対1の比率で使用しています。Gated DeltaNetはMamba2とデルタルールを組み合わせてリカレント状態の更新を行います。この記事では、テキスト拡散モデル、コードワールドモデル、小規模なリカレントトランスフォーマーなどの他の代替案についても言及されていますが、詳細は述べられていません。
出典: Sebastian Raschka — 原文
関連記事 ↓
新着ニュース