Forschung RSS

Forschung 🇺🇸

Neuer technischer Bericht zu DeepSeek-V3: Wie Hardware-Software-Co-Design kostengünstiges Training großer Modelle ermöglicht

Ein neues technisches Paper des DeepSeek-Teams, mit CEO Wenfeng Liang als Co-Autor, untersucht hardwarebewusstes Modell-Co-Design, um die Trainingskosten großer Sprachmodelle zu senken. Am Beispiel von DeepSeek-V3, trainiert auf 2048 NVIDIA H800 GPUs, werden Innovationen in der Speichereffizienz (MLA), spärlicher Berechnung (DeepSeekMoE), FP8-Training und verbindungsbewusstem Routing detailliert beschrieben.

DeepSeekDeepSeek NVIDIANVIDIA Alibaba/QwenAlibaba/Qwen MetaMeta
Synced27.07 · 18:04
Modelle 🇺🇸

Vergleich der Architekturen großer Sprachmodelle: Von DeepSeek V3 bis OLMo 2

Sebastian Raschka vergleicht die Architekturen moderner großer Sprachmodelle, darunter DeepSeek V3 mit Multi-Head Latent Attention und Mixture-of-Experts, sowie OLMo 2 des Allen Institute for Artificial Intelligence mit Post-Norm und QK-norm. Der Artikel behandelt zentrale architektonische Entscheidungen wie Grouped-Query Attention und verschiedene Normalisierungsschemata.

DeepSeekDeepSeek Allen Institute for AIAllen Institute for AI
Sebastian Raschka27.07 · 18:04
Aktuelle Nachrichten