Nieuw technisch rapport over DeepSeek-V3: hoe hardware-software co-design de goedkope training van grote modellen mogelijk maakt
DeepSeek
NVIDIA
Alibaba/Qwen
Meta
Een nieuw technisch paper van het DeepSeek-team, met CEO Wenfeng Liang als co-auteur, onderzoekt hardware-bewust model co-design om de kosten van LLM-training te verlagen. Met DeepSeek-V3 getraind op 2048 NVIDIA H800 GPU's als casestudy, worden innovaties op het gebied van geheugenefficiëntie (MLA), sparse computation (DeepSeekMoE), FP8-training en interconnect-bewuste routing beschreven.
Het 14 pagina's tellende paper, 'Scaling Challenges and Reflections on Hardware for AI Architectures', analyseert hoe hardwarebeperkingen (geheugen, rekenkracht, interconnectbandbreedte) het ontwerp van grote taalmodellen (LLM's) beïnvloeden. DeepSeek-V3 gebruikt Multi-head Latent Attention (MLA) om de KV-cache te comprimeren tot 70 KB per token, tegenover 516 KB voor LLaMA-3.1 405B. De DeepSeekMoE-architectuur activeert slechts 37B van de 671B parameters per token, waardoor het aantal FLOP's per token daalt tot ongeveer 250 GFLOPS, tegenover 394 voor Qwen2.5-72B en 2448 voor LLaMA-3.1 405B. Het model maakt gebruik van FP8 gemengd-precisietraining en LogFMT lagere-precisiecommunicatie, wat het communicatievolume met 50% vermindert ten opzichte van BF16. Om de verminderde NVLink-bandbreedte van de NVIDIA H800 (400 GB/s versus 900 GB/s in de H100) te compenseren, worden via node-aware routing 256 experts gegroepeerd in 8 node-lokale groepen, waarbij elk token maximaal 4 nodes kan bereiken. Het paper pleit voor een uniforme scale-up/scale-out interconnect en speciale communicatie-coprocessors.
Bron: Synced —
origineel
