МоделиИсследования 🇺🇸 27.07.2026 18:04

Сравнение архитектур больших языковых моделей: от DeepSeek V3 до OLMo 2

DeepSeekDeepSeek Allen Institute for AIAllen Institute for AI
Себастьян Рашка опубликовал подробное сравнение архитектур современных открытых LLM, выделив ключевые инновации: Multi-Head Latent Attention (MLA) и Mixture-of-Experts (MoE) в DeepSeek V3, а также особенности нормализации в OLMo 2. Статья охватывает эволюцию от GPT-2 до моделей 2025 года.
Себастьян Рашка представил обзор архитектурных решений в современных открытых больших языковых моделях, сосредоточившись на текстовых возможностях и оставив мультимодальность за рамками статьи. В разделе о DeepSeek V3/R1 подробно разобраны два ключевых компонента: Multi-Head Latent Attention (MLA) и Mixture-of-Experts (MoE). MLA сжимает тензоры ключей и значений в пространство меньшей размерности
Показать ещё ↓
Сокращения
MLA = Multi-Head Latent Attention — многоголовочное латентное внимание
MoE = Mixture-of-Experts — смесь экспертов
MHA = Multi-Head Attention — многоголовочное внимание
GQA = Grouped-Query Attention — групповое внимание по запросам
RMSNorm = Root Mean Square Normalization — нормализация по среднеквадратичному отклонению
Источник: Sebastian Raschka — оригинал
Наши предыдущие публикации по теме ↓
Свежие новости