составили около 5 миллионов долларов за финальный прогон, хотя без учета зарплат исследователей. RLVR использует проверяемые вознаграждения (например, математика, код) для пост-обучения, снижая зависимость от дорогостоящих человеческих аннотаций. Каждый крупный разработчик языковых моделей выпустил вариант для рассуждения. Другие ключевые моменты: 2022 год — RLHF+PPO, 2023 год — LoRA SFT, 2024 год — mid-training. Прогнозы на 2026–2027 годы включают расширения RLVR, масштабирование времени вывода и непрерывное обучение. GRPO стал любимцем исследований, с множеством математических улучшений, таких как фильтрация нулевых градиентов, активная выборка, потеря на уровне токенов и отсутствие потери KL, что значительно повышает стабильность обучения. Архитектурно современные модели по-прежнему используют декодерные трансформеры со слоями MoE и оптимизированные по эффективности механизмы внимания (grouped-query attention, sliding-window attention, multi-head latent attention). Среди новых оптимизаций эффективности — Gated DeltaNets в Qwen3-Next и Kimi Linear, а также слои Mamba-2 в Nemotron 3 от NVIDIA.