Сравнение архитектур больших языковых моделей: от DeepSeek V3 до OLMo 2
Себастьян Рашка опубликовал подробное сравнение архитектур современных открытых LLM, выделив ключевые инновации: Multi-Head Latent Attention (MLA) и Mixture-of-Experts (MoE) в DeepSeek V3, а также особенности нормализации в OLMo 2. Статья охватывает эволюцию от GPT-2 до моделей 2025 года.
DeepSeek
Allen Institute for AI
Sebastian Raschka27.07 · 18:04
