OnderzoekModellen 🇺🇸 27.07.2026 17:03

De staat van LLM's in 2025: Vooruitgang, uitdagingen en voorspellingen

DeepSeekDeepSeek OpenAIOpenAI Alibaba/QwenAlibaba/Qwen Moonshot AIMoonshot AI NVIDIANVIDIA Google/DeepMindGoogle/DeepMind
In 2025 werd de ontwikkeling van LLM's gedomineerd door redeneermodellen die gebruikmaken van reinforcement learning met verifieerbare beloningen (RLVR) en het GRPO-algoritme, aangewakkerd door DeepSeek R1. Belangrijke trends zijn de focus op inference-time scaling, MoE-architecturen en efficiëntieoptimalisaties zoals Gated DeltaNets. Academisch onderzoek richtte zich op GRPO-varianten met verbeteringen zoals het filteren van nulgradiënten en token-level loss.
Nu 2025 ten einde loopt, werd het jaar gedomineerd door redeneermodellen die gebruikmaken van Reinforcement Learning with Verifiable Rewards (RLVR) en Group Relative Policy Optimization (GRPO), in navolging van de release van DeepSeek R1 in januari. DeepSeek R1 toonde aan dat redeneergedrag kon worden ontwikkeld met reinforcement learning, en dat het open-weight model qua prestaties vergelijkbaar was met propriëtaire modellen. Het artikel zorgde ook voor discussie over trainingskosten, met schattingen van ongeveer 5 miljoen dollar voor de uiteindelijke trainingsrun, hoewel salarissen van onderzoekers hier niet in waren meegenomen. RLVR maakt gebruik van verifieerbare beloningen (bijvoorbeeld voor wiskunde of code) tijdens het post-trainen, waardoor de afhankelijkheid van dure menselijke labels afneemt. Elke grote Large Language Model-ontwikkelaar bracht een redeneervariant uit. Andere aandachtsgebieden: 2022 stond in het teken van Reinforcement Learning from Human Feedback (RLHF) en Proximal Policy Optimization (PPO), 2023 van Low-Rank Adaptation via Supervised Fine-Tuning (LoRA SFT), 2024 van mid-training. Voorspellingen voor 2026-2027 omvatten uitbreidingen van RLVR, inference-time scaling en continous learning. GRPO werd een geliefd onderwerp in het onderzoek, met veel wiskundige verbeteringen zoals zero gradient filtering, active sampling, token-level loss en geen KL-verlies (Kullback-Leibler-divergentieverlies), die de stabiliteit van training aanzienlijk verbeteren. Qua architectuur maken state-of-the-art modellen nog steeds gebruik van decoder-style transformers met MoE-lagen en efficiëntie-aangepaste aandacht (grouped-query attention, sliding-window attention, multi-head latent attention). Nieuwere efficiëntietrucs zijn onder andere Gated DeltaNets in Qwen3-Next en Kimi Linear, en Mamba-2-lagen in NVIDIA's Nemotron 3.
Bron: Sebastian Raschka — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws