Stand der LLMs im Jahr 2025: Fortschritte, Herausforderungen und Prognosen
DeepSeek
OpenAI
Alibaba/Qwen
Moonshot AI
NVIDIA
Google/DeepMind
Im Jahr 2025 wurde die Entwicklung großer Sprachmodelle (LLMs) von Reasoning-Modellen dominiert, die Reinforcement Learning mit verifizierbaren Belohnungen (RLVR) und den GRPO-Algorithmus nutzen, ausgelöst durch DeepSeek R1. Zu den wichtigsten Trends gehören der Fokus auf Inference-Time Scaling, MoE-Architekturen und Effizienzoptimierungen wie Gated DeltaNets. Die akademische Forschung hob GRPO-Varianten mit Verbesserungen wie Zero-Gradient-Filtering und Token-Level-Loss hervor.
Mit dem Ende des Jahres 2025 war es von Reasoning-Modellen dominiert, die RLVR und GRPO nutzten, nachdem DeepSeek R1 im Januar veröffentlicht worden war. DeepSeek R1 zeigte, dass Reasoning-Verhalten mit bestärkendem Lernen entwickelt werden konnte, und das Open-Weight-Modell schnitt vergleichbar mit proprietären Modellen ab. Das Papier entfachte auch eine Debatte über die Trainingskosten, wobei Schätzungen für den letzten Durchlauf bei etwa fünf Millionen Dollar lagen, ohne die Gehälter der Forscher. RLVR verwendet überprüfbare Belohnungen (z. B. Mathematik, Code) für das Post-Training und reduziert die Abhängigkeit von teuren menschlichen Annotationen. Jeder große LLM-Entwickler veröffentlichte eine Reasoning-Variante. Weitere Schwerpunkte: 2022 RLHF plus PPO, 2023 LoRA SFT, 2024 Mid-Training. Vorhersagen für 2026 bis 2027 umfassen RLVR-Erweiterungen, Inference-Time Scaling und Continual Learning. GRPO wurde zum Liebling der Forschung, mit vielen mathematischen Verbesserungen wie Zero-Gradient-Filtering, Active Sampling, Token-Level-Loss und ohne KL-Loss, die die Trainingsstabilität erheblich verbessern. Architektonisch verwenden State-of-the-Art-Modelle weiterhin Decoder-Transformer mit MoE-Layern und effizienzoptimierten Aufmerksamkeitsmechanismen (Grouped-Query, Sliding-Window, Multi-Head Latent Attention). Neuere Effizienz-Tweaks umfassen Gated DeltaNets in Qwen3-Next und Kimi Linear sowie Mamba-2-Layer in NVIDIAs Nemotron 3.
Quelle: Sebastian Raschka —
Original
