ИсследованияМодели 🇺🇸 27.07.2026 17:03

Состояние LLM в 2025 году: прогресс, вызовы и прогнозы

DeepSeekDeepSeek OpenAIOpenAI Alibaba/QwenAlibaba/Qwen Moonshot AIMoonshot AI NVIDIANVIDIA Google/DeepMindGoogle/DeepMind
В 2025 году разработка больших языковых моделей (LLM) была сосредоточена на моделях рассуждения, использующих обучение с подкреплением с проверяемыми наградами (RLVR) и алгоритм GRPO, вдохновлённый DeepSeek R1. Ключевые тенденции включают акцент на масштабировании времени вывода, архитектуре MoE и оптимизациях эффективности, таких как Gated DeltaNets. Академические исследования выделили варианты GRPO с улучшениями, включая фильтрацию нулевых градиентов и потери на уровне токенов.
По мере завершения 2025 года год оказался в доминировании моделей рассуждения, использующих RLVR и GRPO, после январского релиза DeepSeek R1. DeepSeek R1 показал, что поведение рассуждения можно развивать с помощью обучения с подкреплением, а его модель с открытыми весами показала производительность, сопоставимую с проприетарными моделями. Статья также разожгла дебаты о стоимости обучения: оценки
Показать ещё ↓
Источник: Sebastian Raschka — оригинал
Наши предыдущие публикации по теме ↓
Свежие новости