Nouveau rapport technique DeepSeek-V3 : comment la co-conception matériel-logiciel permet un entraînement à faible coût de grands modèles
DeepSeek
NVIDIA
Alibaba/Qwen
Meta
Un nouvel article technique de l'équipe DeepSeek, avec le PDG Wenfeng Liang comme co-auteur, explore la co-conception de modèles adaptée au matériel pour réduire les coûts d'entraînement des grands modèles de langage (LLM). En prenant DeepSeek-V3 entraîné sur 2048 GPU NVIDIA H800 comme étude de cas, l'article détaille les innovations en matière d'efficacité mémoire (MLA), de calcul sparse (DeepSeekMoE), d'entraînement FP8 et de routage adapté aux interconnexions.
Le document de 14 pages intitulé « Scaling Challenges and Reflections on Hardware for AI Architectures » analyse comment les contraintes matérielles (mémoire, calcul, bande passante d'interconnexion) influencent la conception des grands modèles de langage (LLM). DeepSeek-V3 utilise l'attention multi-tête latente (MLA) pour compresser le cache KV à 70 Ko par token, contre 516 Ko pour LLaMA-3.1 405B. Son architecture DeepSeekMoE n'active que 37B des 671B paramètres par token, réduisant les FLOPs par token à environ 250 GFLOPS, contre 394 pour Qwen2.5-72B et 2448 pour LLaMA-3.1 405B. Le modèle emploie un entraînement en précision mixte FP8 et une communication à faible précision LogFMT, réduisant le volume de communication de 50 % par rapport au BF16. Pour atténuer la bande passante NVLink réduite du NVIDIA H800 (400 Go/s contre 900 Go/s pour le H100), un routage conscient des nœuds regroupe 256 experts en 8 groupes locaux par nœud, limitant chaque token à 4 nœuds au maximum. Le document plaide en faveur d'une interconnexion unifiée d'extension intra-nœud et inter-nœuds, ainsi que de coprocesseurs de communication dédiés.
Source: Synced —
original
