Исследования 🇺🇸 21.07.2026 01:03

Сравнение архитектур больших языковых моделей: от DeepSeek V3 до GLM-5

DeepSeekDeepSeek Allen Institute for AIAllen Institute for AI
Себастьян Рашка анализирует ключевые архитектурные изменения современных открытых LLM, включая DeepSeek V3, OLMo 2 и другие. Он выделяет Multi-Head Latent Attention (MLA) и Mixture-of-Experts (MoE) в DeepSeek V3, а также особенности нормализации в OLMo 2.
В статье рассматриваются архитектурные новшества современных LLM на примере DeepSeek V3 и OLMo 2. DeepSeek V3 использует Multi-Head Latent Attention (MLA), которая сжимает ключи и значения в низкоразмерное пространство для экономии памяти KV-кэша, и Mixture-of-Experts (MoE) с 256 экспертами, из которых активны только 9 на токен, что позволяет использовать 37 млрд параметров из 671 млрд. OLMo 2 от Allen Institute for AI применяет традиционное Multi-Head Attention (MHA) без GQA или MLA, но отличается размещением RMSNorm после слоёв внимания и FFN (Post-Norm), а также добавлением QK-нормы. Статья отмечает, что, несмотря на внешнее сходство с GPT, современные модели вносят важные улучшения в эффективность и производительность.
Сокращения
MLA = Multi-Head Latent Attention — Многоголовое латентное внимание
MoE = Mixture of Experts — Смесь экспертов
GQA = Grouped-Query Attention — Внимание с группированными запросами
MHA = Multi-Head Attention — Многоголовое внимание
KV = Key-Value — Ключ-значение
RMSNorm = Root Mean Square Normalization — Нормализация по среднеквадратичному отклонению
QK-norm = Query-Key normalization — Нормализация запросов и ключей
Post-LN = Post-Layer Normalization — Пост-нормализация слоя
Pre-LN = Pre-Layer Normalization — Пре-нормализация слоя
FFN = Feed-Forward Network — Сеть прямого распространения
Источник: Sebastian Raschka — оригинал

Наши прошлые публикации по теме

Есть свежие новости