ModelleForschung 🇺🇸 27.07.2026 18:04

Vergleich der Architekturen großer Sprachmodelle: Von DeepSeek V3 bis OLMo 2

DeepSeekDeepSeek Allen Institute for AIAllen Institute for AI
Sebastian Raschka veröffentlichte einen detaillierten Vergleich der Architekturen moderner offener großer Sprachmodelle und hob dabei wichtige Innovationen hervor: Multi-Head Latent Attention (MLA) und Mixture-of-Experts (MoE) in DeepSeek V3 sowie Normalisierungsmerkmale in OLMo 2. Der Artikel behandelt die Entwicklung von GPT-2 bis zu Modellen aus dem Jahr 2025.
Себастьян Рашка представил обзор архитектурных решений в современных открытых больших языковых моделях, сосредоточившись на текстовых возможностях и оставив мультимодальность за рамками статьи. В разделе о DeepSeek V3/R1 подробно разобраны два ключевых компонента: Multi-Head Latent Attention (MLA) и Mixture-of-Experts (MoE). MLA сжимает тензоры ключей и значений в пространство меньшей размерности перед сохранением в KV-кэше, что снижает использование памяти, а затем восстанавливает их при инференсе; по данным ablation studies из статьи DeepSeek-V2, MLA показывает лучшее качество моделирования, чем Grouped-Query Attention (GQA). MoE в DeepSeek V3 использует 256 экспертов на модуль, из которых активны только 9 (один общий и восемь, выбранных роутером), что позволяет модели с 671 миллиардом параметров использовать лишь 37 миллиардов за шаг инференса. В разделе об OLMo 2 отмечено, что модель от Allen Institute for AI примечательна прозрачностью и использует традиционное Multi-Head Attention (MHA) вместо MLA или GQA. Ключевое архитектурное отличие OLMo 2 — расположение слоёв нормализации: она применяет Post-Norm (RMSNorm после подуровней внимания и FeedForward), в отличие от более распространённого Pre-Norm, что, согласно исследованиям, улучшает сходимость градиентов при инициализации.
Quelle: Sebastian Raschka — Original
Unsere früheren Beiträge zu diesem Thema ↓
Aktuelle Nachrichten