研究 🇺🇸 27.07.2026 12:03

LLM研究論文:2026年リスト(1月~5月)

NVIDIANVIDIA Alibaba/QwenAlibaba/Qwen MistralMistral BaiduBaidu CohereCohere Technology Innovation InstituteTechnology Innovation Institute MiniMaxMiniMax
Sebastian Raschkaが2026年1月から5月にかけてブックマークしたLLM研究論文の厳選リストをまとめました。アーキテクチャ、効率的なトレーニング、推論、エージェントなどがカバーされています。リストにはハイブリッドアーキテクチャ(Nemotron 3、Mamba-3)、推論モデル、実用的なサービングインフラが含まれています。
Sebastian Raschkaは、読んだり引用したい研究論文のリストを継続的に更新する習慣を維持してきた。2026年前半には、1月から5月にかけてブックマークした論文を厳選したリストを作成した。このリストは網羅的ではないが、推論モデル、強化学習、効率的な推論、エージェントハーネス、ツール使用、長いコンテキスト、拡散言語モデル、実用的なサービングインフラに対する彼の関心を反映している。カテゴリには、アーキテクチャとモデル設計、効率的なトレーニングとスケーリング、推論効率とKVキャッシュ、スパースアテンションと長いコンテキスト、推論とテスト時計算、強化学習とRLVR(Reinforcement Learning from Verifiable Rewards)、エージェントシステムとツール使用、コーディングエージェントとソフトウェア工学、拡散言語モデル、モデル評価とベンチマークが含まれる。注目すべき論文として、効率性のためにハイブリッドMamba-Transformerアーキテクチャを採用したNemotron 3 Superや、アテンションの代替としてのMamba-3とGated DeltaNet-2が挙げられる。Raschkaは、LLMがOpenClawのようなエージェントシステムで使用されるにつれて、長いコンテキストの効率性が重要になると強調している。また、Qwen3.6におけるGated DeltaNet層のように、アテンションと代替層を交互に配置するハイブリッドアーキテクチャのトレンドも指摘している。
出典: Sebastian Raschka — 原文
関連記事 ↓
新着ニュース