RechercheModèles 🇺🇸 27.07.2026 17:03

État des LLM en 2025 : Progrès, Défis et Prévisions

DeepSeekDeepSeek OpenAIOpenAI Alibaba/QwenAlibaba/Qwen Moonshot AIMoonshot AI NVIDIANVIDIA Google/DeepMindGoogle/DeepMind
En 2025, le développement des LLM a été dominé par les modèles de raisonnement utilisant l'apprentissage par renforcement avec récompenses vérifiables (RLVR) et l'algorithme GRPO, lancé par DeepSeek R1. Les tendances clés incluent un accent sur la mise à l'échelle au moment de l'inférence, les architectures MoE et des ajustements d'efficacité comme les Gated DeltaNets. La recherche universitaire a mis en lumière des variantes du GRPO avec des améliorations telles que le filtrage de gradient zéro et la perte au niveau des jetons.
Alors que 2025 touche à sa fin, l'année a été dominée par les modèles de raisonnement utilisant RLVR et GRPO, suite à la sortie de DeepSeek R1 en janvier. DeepSeek R1 a montré qu'un comportement de raisonnement pouvait être développé avec l'apprentissage par renforcement, et son modèle à poids ouverts s'est révélé comparable aux modèles propriétaires. L'article a également alimenté le débat sur les coûts d'entraînement, avec des estimations autour de 5 millions de dollars pour la phase finale, bien que cela exclue les salaires des chercheurs. RLVR utilise des récompenses vérifiables (par exemple, mathématiques, code) pour le post-entraînement, réduisant ainsi la dépendance aux annotations humaines coûteuses. Chaque grand développeur de LLM a publié une variante de raisonnement. Autres points d'intérêt : RLHF+PPO en 2022, LoRA SFT en 2023, et mid-training en 2024. Les prévisions pour 2026-2027 incluent des extensions de RLVR, une mise à l'échelle au moment de l'inférence et un apprentissage continu. GRPO est devenu un chouchou de la recherche, avec de nombreuses améliorations mathématiques comme le filtrage de gradient nul, l'échantillonnage actif, la perte au niveau des jetons et l'absence de perte KL (Kullback-Leibler), ce qui améliore considérablement la stabilité de l'entraînement. Sur le plan architectural, les modèles de pointe utilisent toujours des transformeurs de type décodeur avec des couches MoE et une attention optimisée pour l'efficacité (attention groupée, fenêtre glissante, attention latente multi-tête). Les nouvelles astuces d'efficacité incluent les Gated DeltaNets dans Qwen3-Next et Kimi Linear, ainsi que les couches Mamba-2 dans le Nemotron 3 de NVIDIA.
Source: Sebastian Raschka — original
Nos articles précédents sur ce sujet ↓
Infos fraîches