RisetPerangkat Keras & Inferensi 🇺🇸 27.07.2026 18:04

Laporan teknis DeepSeek-V3 baru: bagaimana desain bersama perangkat keras dan perangkat lunak memungkinkan pelatihan model besar dengan biaya rendah

DeepSeekDeepSeek NVIDIANVIDIA Alibaba/QwenAlibaba/Qwen MetaMeta
Sebuah makalah teknis baru dari tim DeepSeek, dengan CEO Wenfeng Liang sebagai rekan penulis, mengeksplorasi desain bersama model yang sadar perangkat keras untuk mengurangi biaya pelatihan LLM. Menggunakan DeepSeek-V3 yang dilatih pada 2048 GPU NVIDIA H800 sebagai studi kasus, makalah ini merinci inovasi dalam efisiensi memori (MLA), komputasi jarang (DeepSeekMoE), pelatihan FP8, dan perutean yang sadar interkoneksi.
Makalah setebal 14 halaman berjudul 'Scaling Challenges and Reflections on Hardware for AI Architectures' menganalisis bagaimana kendala perangkat keras (memori, komputasi, bandwidth interkoneksi) membentuk desain LLM. DeepSeek-V3 menggunakan Multi-head Latent Attention (MLA) untuk mengompresi cache KV menjadi 70 KB per token, dibandingkan dengan 516 KB untuk LLaMA-3.1 405B. Arsitektur DeepSeekMoE-nya hanya mengaktifkan 37B dari 671B parameter per token, mengurangi FLOP per token menjadi sekitar 250 GFLOPS, dibandingkan dengan 394 untuk Qwen2.5-72B dan 2448 untuk LLaMA-3.1 405B. Model ini menggunakan pelatihan mixed-precision FP8 dan komunikasi presisi rendah LogFMT, memangkas volume komunikasi sebesar 50% dibandingkan BF16. Untuk mengurangi bandwidth NVLink NVIDIA H800 yang lebih rendah (400 GB/s vs. 900 GB/s pada H100), perutean sadar node mengelompokkan 256 pakar ke dalam 8 grup lokal node, membatasi setiap token maksimal ke 4 node. Makalah ini menganjurkan interkoneksi scale-up/scale-out yang terpadu dan koprosesor komunikasi khusus.
Sumber: Synced — asli
Postingan kami sebelumnya tentang topik ini ↓
Berita terbaru