RechercheModèles 🇺🇸 27.07.2026 18:04

Nouveau rapport technique DeepSeek-V3 : comment la co-conception matériel-logiciel permet un entraînement à faible coût des grands modèles

DeepSeekDeepSeek NVIDIANVIDIA Alibaba/QwenAlibaba/Qwen MetaMeta
Un nouveau rapport technique de 14 pages de l'équipe DeepSeek-V3, co-écrit par le PDG de DeepSeek, Wenfeng Liang, a été publié. Le document analyse les défis de passage à l'échelle des grands modèles de langage et le rôle de l'infrastructure matérielle, proposant des solutions basées sur la conception conjointe des modèles et du matériel pour un entraînement et une inférence rentables.
L'équipe de DeepSeek-V3 a publié un nouveau rapport technique dont le PDG de la société, Wenfeng Liang, est co-auteur. Ce document de 14 pages aborde les problèmes de passage à l'échelle des grands modèles de langage (LLM) et reflète les contraintes matérielles. Contrairement à la publication précédente qui décrivait l'architecture de V3, ce nouveau rapport se concentre sur la relation entre le développement des modèles et leur matériel. DeepSeek-V3 a été entraînée sur un cluster de 2 048 GPU NVIDIA H800 et illustre comment la prise en compte des caractéristiques du matériel permet de surmonter les goulots d'étranglement tels que le manque de mémoire, l'efficacité de calcul et la bande passante d'interconnexion. Parmi les décisions architecturales clés figure le mécanisme Multi-head Latent Attention (MLA), qui compresse le cache de clés-valeurs à 70 Ko par jeton (contre 516 Ko pour LLaMA-3.1 405B et 327 Ko pour Qwen-2.5 72B). Les économies de calcul sont obtenues grâce à l'architecture creuse DeepSeekMoE : le modèle de 671 milliards de paramètres n'en active que 37 milliards par jeton, ce qui nécessite environ 250 GFLOPS par jeton contre 394 pour Qwen-2.5 72B et 2 448 pour LLaMA-3.1 405B. Pour accélérer l'inférence, une double architecture de micro-lots est utilisée, superposant la communication et les calculs, ainsi qu'une séparation en phases prefill et decode. DeepSeek-V3 est devenue le premier grand modèle connu publiquement à être entraîné avec une précision mixte FP8, ce qui a réduit les coûts de calcul. Pour les échanges inter-nœuds, les données sont compressées en FP8 (LogFMT), réduisant de moitié le volume de communication. En raison des restrictions réglementaires, le NVIDIA H800 a une bande passante NVLink deux fois plus faible (400 Go/s contre 900), DeepSeek a donc appliqué un « routage orienté nœud » des experts MoE, regroupant les experts en 8 groupes de 32 sur un même nœud et limitant à quatre le nombre de nœuds destinataires pour chaque jeton. Le document aborde également les axes de recherche prometteurs : fusion du scale-up et du scale-out en un seul bus (UB), introduction de coprocesseurs spécialisés pour le trafic réseau, gestion dynamique de la bande passante NVLink/PCIe et utilisation de la topologie Multi-Plane Fat-Tree.
Source: Synced — original
Nos articles précédents sur ce sujet ↓
Infos fraîches