2025年のLLMの現状:進歩、課題、予測
DeepSeek
OpenAI
Alibaba/Qwen
Moonshot AI
NVIDIA
Google/DeepMind
2025年、LLM開発はDeepSeek R1に触発された検証可能な報酬を用いた強化学習(RLVR)とGRPOアルゴリズムを用いた推論モデルによって支配されました。主なトレンドとして、推論時スケーリング、MoEアーキテクチャ、Gated DeltaNetsのような効率化の調整に焦点が当てられています。学術研究では、ゼロ勾配フィルタリングやトークンレベル損失などの改良を加えたGRPOのバリアントが注目されました。
2025年が終わるにあたり、今年はDeepSeek R1の1月リリースに続き、RLVR(検証可能な報酬を用いた強化学習)とGRPO(グループ相対方策最適化)を採用した推論モデルが席巻した。DeepSeek R1は、推論行動が強化学習によって発展可能であることを示し、そのオープンウェイトモデルはプロプライエタリモデルに匹敵する性能を達成した。また、論文ではトレーニングコストに関する議論が巻き起こり、最終ランでは研究者の給与を除いて約500万ドルと見積もられた。RLVRは、事後トレーニングにおいて検証可能な報酬(例:数学、コード)を活用し、高価な人間によるラベルへの依存を低減する。主要なLLM開発者各社はすべて、推論バリアントをリリースした。他の焦点としては、2022年のRLHF(人間のフィードバックからの強化学習)+PPO(近接方策最適化)、2023年のLoRA(低ランク適応)SFT(教師ありファインチューニング)、2024年の中間トレーニングが挙げられる。2026年から2027年にかけての予測としては、RLVRの拡張、推論時スケーリング、継続学習が挙げられる。GRPOは研究の寵児となり、ゼロ勾配フィルタリング、アクティブサンプリング、トークンレベルの損失、KL損失なしなど、多くの数学的改善が加えられ、トレーニングの安定性が大幅に向上した。アーキテクチャ的には、最先端モデルは依然としてMoE(混合エキスパート)層と効率化されたアテンション(グループ化クエリアテンション、スライディングウィンドウアテンション、マルチヘッド潜在アテンション)を備えたデコーダー型トランスフォーマーを使用している。新しい効率化の工夫としては、Qwen3-NextとKimi LinearにおけるGated DeltaNet、NVIDIAのNemotron 3におけるMamba-2層が挙げられる。
出典: Sebastian Raschka —
原文
