Nieuw DeepSeek-V3 Technisch Rapport: Hoe Hardware-Software Co-design Goedkope Training van Grote Modellen Mogelijk Maakt
DeepSeek
NVIDIA
Alibaba/Qwen
Meta
Een nieuw 14 pagina's tellend technisch rapport van het DeepSeek-V3 team, mede-auteur DeepSeek CEO Wenfeng Liang, is uitgebracht. Het document analyseert de schaalvergrotinguitdagingen van grote taalmodellen en de rol van hardware-infrastructuur, en stelt oplossingen voor op basis van gezamenlijk ontwerp van modellen en hardware voor kosteneffectieve training en inferentie.
Het DeepSeek-V3-team heeft een nieuw technisch rapport uitgebracht met CEO Wenfeng Liang als co-auteur. Het 14 pagina's tellende document richt zich op de problemen rond het schalen van grote taalmodellen (large language models, LLM's) en de reflectie van hardwarebeperkingen. In tegenstelling tot de eerdere publicatie, die de architectuur van V3 beschreef, concentreert het nieuwe rapport zich op de wisselwerking tussen modelontwikkeling en de bijbehorende hardware. DeepSeek-V3 werd getraind op een cluster van 2048 NVIDIA H800 GPU's en dient als voorbeeld van hoe rekening houden met de kenmerken van de 'hardware' knelpunten kan overwinnen - zoals geheugentekort, rekenefficiëntie en bandbreedte van de interconnect. Tot de belangrijkste architectonische beslissingen behoort het Multi-head Latent Attention (MLA)-mechanisme, dat de key-value-cache comprimeert tot 70 KB per token (tegenover 516 KB bij LLaMA-3.1 405B en 327 KB bij Qwen-2.5 72B). Rekenbesparingen worden bereikt dankzij de sparse architectuur DeepSeekMoE: het model met 671 miljard parameters activeert slechts 37 miljard per token, wat ongeveer 250 GFLOPS per token vereist, tegenover 394 bij Qwen-2.5 72B en 2448 bij LLaMA-3.1 405B. Om de inferentie te versnellen wordt een dubbele microbatch-architectuur gebruikt, die communicatie overlapt met berekeningen, evenals een opsplitsing in prefill- en decode-fasen. DeepSeek-V3 is het eerste publiekelijk bekende grote model dat is getraind met FP8 gemengde precisie, wat de rekenkosten verlaagde. Voor inter-node-uitwisseling worden gegevens gecomprimeerd met FP8 (LogFMT), waardoor de communicatieomvang wordt gehalveerd. Vanwege regelgevingsbeperkingen heeft de NVIDIA H800 de helft van de NVLink-bandbreedte (400 GB/s versus 900), dus paste DeepSeek 'node-gerichte routering' van MoE-experts toe, door experts te groeperen in 8 groepen van 32 op één node en het aantal ontvangende nodes per token te beperken tot vier. In het document worden ook veelbelovende richtingen besproken: het samenvoegen van scale-up en scale-out in één bus (UB), het inzetten van gespecialiseerde coprocessors voor netwerkverkeer, dynamisch beheer van NVLink/PCIe-bandbreedte en het gebruik van de Multi-Plane Fat-Tree-topologie.
Bron: Synced —
origineel
