InvestigaciónModelos 🇺🇸 27.07.2026 17:03

Estado de los LLM en 2025: Avances, Desafíos y Predicciones

DeepSeekDeepSeek OpenAIOpenAI Alibaba/QwenAlibaba/Qwen Moonshot AIMoonshot AI NVIDIANVIDIA Google/DeepMindGoogle/DeepMind
En 2025, el desarrollo de los modelos de lenguaje de gran escala (LLM) estuvo dominado por modelos de razonamiento que utilizan aprendizaje por refuerzo con recompensas verificables (RLVR, por sus siglas en inglés) y el algoritmo GRPO, impulsado por DeepSeek R1. Las tendencias clave incluyen un enfoque en la escalabilidad del tiempo de inferencia, arquitecturas MoE y ajustes de eficiencia como Gated DeltaNets. La investigación académica destacó variantes de GRPO con mejoras como el filtrado de gradiente cero y la pérdida a nivel de token.
Al concluir 2025, el año estuvo dominado por los modelos de razonamiento que utilizan RLVR y GRPO, tras el lanzamiento de DeepSeek R1 en enero. DeepSeek R1 demostró que el comportamiento de razonamiento podía desarrollarse con aprendizaje por refuerzo, y su modelo de pesos abiertos rindió de manera comparable a los propietarios. El artículo también avivó el debate sobre los costos de entrenamiento, con estimaciones de alrededor de 5 millones de dólares para la ejecución final, aunque excluyendo los salarios de los investigadores. RLVR utiliza recompensas verificables (por ejemplo, matemáticas, código) para el post-entrenamiento, reduciendo la dependencia de las costosas etiquetas humanas. Todos los principales desarrolladores de LLM lanzaron una variante de razonamiento. Otros puntos de interés: 2022 RLHF+PPO, 2023 LoRA SFT, 2024 entrenamiento intermedio. Las predicciones para 2026-2027 incluyen extensiones de RLVR, escalado en tiempo de inferencia y aprendizaje continuo. GRPO se convirtió en el favorito de la investigación, con muchas mejoras matemáticas como filtrado de gradiente cero, muestreo activo, pérdida a nivel de token y sin pérdida KL, que mejoran significativamente la estabilidad del entrenamiento. Arquitectónicamente, los modelos de última generación todavía utilizan transformadores tipo decodificador con capas MoE y atención optimizada para eficiencia (consulta agrupada, ventana deslizante, atención latente de múltiples cabezas). Las optimizaciones de eficiencia más recientes incluyen Gated DeltaNets en Qwen3-Next y Kimi Linear, y capas Mamba-2 en Nemotron 3 de NVIDIA.
Fuente: Sebastian Raschka — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas