AraştırmaDonanım ve Çıkarım 🇺🇸 27.07.2026 18:04

Yeni DeepSeek-V3 teknik raporu: donanım-yazılım birlikte tasarımı büyük modellerin düşük maliyetli eğitimini nasıl sağlıyor

DeepSeekDeepSeek NVIDIANVIDIA Alibaba/QwenAlibaba/Qwen MetaMeta
CEO Wenfeng Liang'ın ortak yazar olduğu DeepSeek ekibinden yeni bir teknik makale, büyük dil modellerinin eğitim maliyetlerini düşürmek için donanım farkındalıklı model birlikte tasarımını inceliyor. 2048 NVIDIA H800 GPU üzerinde eğitilmiş DeepSeek-V3'ü örnek olay olarak kullanan makale, bellek verimliliği (MLA), seyrek hesaplama (DeepSeekMoE), FP8 eğitimi ve ara bağlantı farkındalıklı yönlendirmedeki yenilikleri detaylandırıyor.
14 sayfalık 'AI Mimarileri için Donanım Konusunda Ölçeklendirme Zorlukları ve Düşünceler' başlıklı makale, donanım kısıtlamalarının (bellek, hesaplama, ara bağlantı bant genişliği) büyük dil modellerinin (LLM) tasarımını nasıl şekillendirdiğini analiz ediyor. DeepSeek-V3, çok başlı gizli dikkat (multi-head latent attention - MLA) kullanarak KV önbelleğini token başına 70 kilobayta (KB) sıkıştırırken, LLaMA-3.1 405B'de bu değer 516 KB. DeepSeekMoE mimarisi, token başına 671 milyar parametrenin (B) yalnızca 37 milyarını (B) etkinleştirerek token başına kayan nokta işlemi (FLOP) sayısını yaklaşık 250 milyara (GFLOPS) düşürürken, Qwen2.5-72B'de 394 GFLOPS, LLaMA-3.1 405B'de ise 2448 GFLOPS'tur. Model, FP8 karma hassasiyetli eğitim ve LogFMT düşük hassasiyetli iletişim kullanarak, BF16'ya kıyasla iletişim hacmini %50 azaltır. NVIDIA H800'ün düşürülmüş NVLink bant genişliğini (H100'deki 900 gigabayt/saniye (GB/s) yerine 400 GB/s) hafifletmek için düğüm bilinçli yönlendirme (node-aware routing), 256 uzmanı 8 düğüm yerel grubuna ayırır ve her token'ı en fazla 4 düğümle sınırlar. Makale, birleşik ölçek büyütme/ölçek genişletme ara bağlantısı ve özel iletişim işlemcilerini savunuyor.
Kaynak: Synced — orijinal
Bu konudaki önceki yazılarımız ↓
Güncel haberler