Сравнение архитектур больших языковых моделей: от DeepSeek V3 до GLM-5
DeepSeek
Allen Institute for AI
Себастьян Рашка анализирует ключевые архитектурные изменения современных открытых LLM, включая DeepSeek V3, OLMo 2 и другие. Он выделяет Multi-Head Latent Attention (MLA) и Mixture-of-Experts (MoE) в DeepSeek V3, а также особенности нормализации в OLMo 2.
В статье рассматриваются архитектурные новшества современных LLM на примере DeepSeek V3 и OLMo 2. DeepSeek V3 использует Multi-Head Latent Attention (MLA), которая сжимает ключи и значения в низкоразмерное пространство для экономии памяти KV-кэша, и Mixture-of-Experts (MoE) с 256 экспертами, из которых активны только 9 на токен, что позволяет использовать 37 млрд параметров из 671 млрд. OLMo 2 от Allen Institute for AI применяет традиционное Multi-Head Attention (MHA) без GQA или MLA, но отличается размещением RMSNorm после слоёв внимания и FFN (Post-Norm), а также добавлением QK-нормы. Статья отмечает, что, несмотря на внешнее сходство с GPT, современные модели вносят важные улучшения в эффективность и производительность.
- Сокращения
- MLA = Multi-Head Latent Attention — Многоголовое латентное внимание
- MoE = Mixture of Experts — Смесь экспертов
- GQA = Grouped-Query Attention — Внимание с группированными запросами
- MHA = Multi-Head Attention — Многоголовое внимание
- KV = Key-Value — Ключ-значение
- RMSNorm = Root Mean Square Normalization — Нормализация по среднеквадратичному отклонению
- QK-norm = Query-Key normalization — Нормализация запросов и ключей
- Post-LN = Post-Layer Normalization — Пост-нормализация слоя
- Pre-LN = Pre-Layer Normalization — Пре-нормализация слоя
- FFN = Feed-Forward Network — Сеть прямого распространения
Источник: Sebastian Raschka —
оригинал
