Comparaison des architectures de grands modèles de langage : de DeepSeek V3 à OLMo 2
DeepSeek
Allen Institute for AI
Sebastian Raschka compare les architectures des LLM modernes, notamment DeepSeek V3 avec l'attention latente multi-têtes et un mélange d'experts, et OLMo 2 de l'Allen Institute for AI avec la post-normalisation et la normalisation QK. L'article aborde les décisions architecturales clés telles que l'attention par groupes de requêtes et divers schémas de normalisation.
Dans son article, Sebastian Raschka examine les caractéristiques architecturales des grands modèles de langage modernes, en comparant DeepSeek V3/R1, OLMo 2, et d'autres. DeepSeek V3 utilise l'attention latente multi-tête (MLA), qui compresse les clés et les valeurs dans un espace de faible dimension pour économiser la mémoire du cache KV, et un mélange d'experts (MoE) avec 256 experts, dont seulement 9 sont actifs (un expert partagé et 8 sélectionnés par le routeur), ce qui lui permet d'utiliser seulement 37 milliards de paramètres par étape malgré un total de 671 milliards. OLMo 2 de l'Allen Institute for AI, quant à lui, utilise une attention multi-tête traditionnelle mais avec une post-normalisation (RMSNorm après les couches d'attention et de réseau feed-forward) et une normalisation QK pour stabiliser l'entraînement. L'article mentionne également l'attention à requêtes groupées comme alternative à l'attention multi-tête utilisée dans d'autres modèles.
Source: Sebastian Raschka —
original
