ModèlesRecherche 🇺🇸 27.07.2026 18:04

Comparaison des architectures de grands modèles de langage : de DeepSeek V3 à OLMo 2

DeepSeekDeepSeek Allen Institute for AIAllen Institute for AI
Sebastian Raschka a publié une comparaison détaillée des architectures des LLM ouverts modernes, mettant en lumière les innovations clés : l'attention latente multi-têtes (MLA) et le mélange d'experts (MoE) dans DeepSeek V3, ainsi que les caractéristiques de normalisation dans OLMo 2. L'article couvre l'évolution de GPT-2 aux modèles de 2025.
Sebastian Raschka a présenté une revue des solutions architecturales dans les grands modèles de langage ouverts modernes, en se concentrant sur les capacités textuelles et en laissant la multimodalité en dehors de l'article. Dans la section sur DeepSeek V3/R1, deux composants clés sont détaillés : l'attention latente multi-tête (MLA) et le mélange d'experts (MoE). MLA compresse les tenseurs de clés et de valeurs dans un espace de plus petite dimension avant de les stocker dans le cache KV, ce qui réduit l'utilisation de la mémoire, puis les reconstitue lors de l'inférence ; selon les études d'ablation de l'article DeepSeek-V2, MLA présente une meilleure qualité de modélisation que l'attention par requêtes groupées (GQA). MoE dans DeepSeek V3 utilise 256 experts par module, dont seulement 9 sont actifs (un expert commun et huit sélectionnés par le routeur), ce qui permet au modèle de 671 milliards de paramètres de n'en utiliser que 37 milliards par étape d'inférence. Dans la section sur OLMo 2, il est noté que le modèle de l'Allen Institute for AI se distingue par sa transparence et utilise l'attention multi-tête (MHA) traditionnelle au lieu de MLA ou GQA. La principale différence architecturale d'OLMo 2 est l'emplacement des couches de normalisation : il applique une post-normalisation (RMSNorm après les sous-couches d'attention et FeedForward), contrairement à la pré-normalisation plus courante, ce qui, selon les recherches, améliore la convergence des gradients lors de l'initialisation.
Source: Sebastian Raschka — original
Nos articles précédents sur ce sujet ↓
Infos fraîches