Состояние LLM в 2025 году: прогресс, вызовы и прогнозы
DeepSeek
OpenAI
Alibaba/Qwen
Moonshot AI
NVIDIA
Google/DeepMind
В 2025 году разработка больших языковых моделей (LLM) была сосредоточена на моделях рассуждения, использующих обучение с подкреплением с проверяемыми наградами (RLVR) и алгоритм GRPO, вдохновлённый DeepSeek R1. Ключевые тенденции включают акцент на масштабировании времени вывода, архитектуре MoE и оптимизациях эффективности, таких как Gated DeltaNets. Академические исследования выделили варианты GRPO с улучшениями, включая фильтрацию нулевых градиентов и потери на уровне токенов.
По мере завершения 2025 года год оказался в доминировании моделей рассуждения, использующих RLVR и GRPO, после январского релиза DeepSeek R1. DeepSeek R1 показал, что поведение рассуждения можно развивать с помощью обучения с подкреплением, а его модель с открытыми весами показала производительность, сопоставимую с проприетарными моделями. Статья также разожгла дебаты о стоимости обучения: оценки
Показать ещё ↓
Источник: Sebastian Raschka —
оригинал
