ИсследованияМодели 🇺🇸 27.07.2026 12:03

Обзор исследовательских работ по LLM за первую половину 2026 года

NVIDIANVIDIA Alibaba/QwenAlibaba/Qwen MistralMistral BaiduBaidu CohereCohere Technology Innovation InstituteTechnology Innovation Institute MiniMaxMiniMax
Себастьян Рашка опубликовал курируемый список ключевых научных работ по большим языковым моделям (LLM) за январь – май 2026 года. В подборке выделены тренды: гибридные архитектуры (чередование attention и state-space слоёв), эффективный инференс, агентные системы и диффузионные языковые модели. Особое внимание уделено моделям Nemotron 3 (Nvidia) с гибридным дизайном и Qwen3.6 с Gated DeltaNet.
Себастьян Рашка, известный специалист по машинному обучению, подготовил для первой половины 2026 года подборку научных статей по большим языковым моделям (LLM), которые он отобрал для себя. Список организован по категориям: архитектура и дизайн, эффективное обучение и масштабирование, эффективность инференса и KV-кеш, разреженное внимание и длинный контекст, рассуждения и вычислительные затраты
Показать ещё ↓
Сокращения
LLM = Large Language Model — большая языковая модель
MoE = Mixture of Experts — смесь экспертов
RLVR = Reinforcement Learning from Verifiable Rewards — обучение с подкреплением на основе проверяемых наград
Источник: Sebastian Raschka — оригинал
Наши предыдущие публикации по теме ↓
Свежие новости