AraştırmaModeller 🇺🇸 27.07.2026 18:04

New DeepSeek-V3 Technical Report: How Hardware-Software Codesign Enables Low-Cost Training of Large Models

DeepSeekDeepSeek NVIDIANVIDIA Alibaba/QwenAlibaba/Qwen MetaMeta
A new 14-page technical report from the DeepSeek-V3 team, co-authored by DeepSeek CEO Wenfeng Liang, has been released. The document analyzes the scaling challenges of large language models and the role of hardware infrastructure, proposing solutions based on joint design of models and hardware for cost-effective training and inference.
DeepSeek-V3 ekibi, şirketin CEO'su Wenfeng Liang'ın ortak yazar olarak yer aldığı yeni bir teknik rapor yayınladı. 14 sayfalık belge, büyük dil modellerinin (LLM - Large Language Model) ölçeklendirilmesi sorunlarına ve donanım kısıtlamalarının yansıtılmasına odaklanıyor. V3 mimarisini tanımlayan önceki yayından farklı olarak yeni rapor, model geliştirme ile donanım arasındaki ilişkiye odaklanıyor. DeepSeek-V3, 2048 adet NVIDIA H800 GPU'dan oluşan bir küme üzerinde eğitildi ve "donanım" özelliklerinin dikkate alınmasının bellek yetersizliği, hesaplama verimliliği ve bağlantı bant genişliği gibi darboğazların nasıl aşılabileceğini gösteren bir örnek teşkil ediyor. Temel mimari kararlar arasında, anahtar-değer önbelleğini token başına 70 KB'ye sıkıştıran Çok Başlı Gizli Dikkat (MLA - Multi-head Latent Attention) mekanizması yer alıyor (LLaMA-3.1 405B için 516 KB ve Qwen-2.5 72B için 327 KB ile karşılaştırıldığında). Hesaplama tasarrufu, DeepSeekMoE'nin seyrek mimarisi sayesinde elde ediliyor: 671 milyar parametreli model, token başına yalnızca 37 milyarını etkinleştiriyor ve bu da token başına yaklaşık 250 GFLOPS gerektiriyor (Qwen-2.5 72B için 394 GFLOPS ve LLaMA-3.1 405B için 2448 GFLOPS). Çıkarımı hızlandırmak için, iletişimi hesaplamayla örtüşen çift mikro grup mimarisi ve prefill ile decode aşamalarına bölme kullanılıyor. DeepSeek-V3, FP8 karma hassasiyetle eğitilen ilk kamuya açık büyük model oldu ve bu da hesaplama maliyetlerini düşürdü. Düğümler arası değişim için veriler, FP8 (LogFMT) kullanılarak sıkıştırılıyor ve bu da iletişim hacmini yarıya indiriyor. Düzenleyici kısıtlamalar nedeniyle NVIDIA H800, iki kat daha düşük NVLink bant genişliğine (400 GB/s'ye karşı 900 GB/s) sahip olduğundan, DeepSeek, MoE uzmanlarını bir düğümde 32'şerli 8 gruba ayıran ve her token için alıcı düğüm sayısını dört ile sınırlayan "düğüm odaklı yönlendirme" uyguladı. Belgede ayrıca gelecek vaat eden yönler de tartışılıyor: scale-up ve scale-out'u tek bir veriyolunda (UB) birleştirmek, ağ trafiği için özel yardımcı işlemciler tanıtmak, NVLink/PCIe bant genişliğinin dinamik yönetimi ve Çok Düzlemli Yağ Ağacı (Multi-Plane Fat-Tree) topolojisinin kullanımı.
Kaynak: Synced — orijinal
Bu konudaki önceki yazılarımız ↓
Güncel haberler