Neuer technischer Bericht zu DeepSeek-V3: Wie Hardware-Software-Co-Design kostengünstiges Training großer Modelle ermöglicht
Ein neues technisches Paper des DeepSeek-Teams, mit CEO Wenfeng Liang als Co-Autor, untersucht hardwarebewusstes Modell-Co-Design, um die Trainingskosten großer Sprachmodelle zu senken. Am Beispiel von DeepSeek-V3, trainiert auf 2048 NVIDIA H800 GPUs, werden Innovationen in der Speichereffizienz (MLA), spärlicher Berechnung (DeepSeekMoE), FP8-Training und verbindungsbewusstem Routing detailliert beschrieben.
DeepSeek
NVIDIA
Alibaba/Qwen
Meta

