Donanım ve Çıkarımİş ve Pazar 🇺🇸 27.07.2026 02:05

Performance per watt is the key metric for AI infrastructure efficiency

NVIDIANVIDIA CoreWeaveCoreWeave Perplexity AIPerplexity AI Fireworks AIFireworks AI
With limited energy consumption, the 'performance per watt' metric becomes crucial for the return on investment of AI factories. NVIDIA claims its Blackwell NVL72 platform with a 72-GPU domain provides up to 25x advantage over the Hopper generation, and the future Vera Rubin will continue to improve rack-level energy efficiency.
Güç, yapay zeka altyapısının ayrılmaz bir sınırlamasıdır. Sabit bir enerji bütçesi dahilinde bir yapay zeka fabrikasının üretebileceği token sayısı, gelirini ve kârlılığını belirler. Bu nedenle, watt başına performans — hile yapılamayan, yalnızca gerçek sonuçlarla kazanılabilen bir metrik — yapay zeka fabrikalarının temelini oluşturur. Ajan tabanlı yapay zekadan gelen token talebi arttıkça, kuruluşların bugün aldığı altyapı kararları, sınırlı güç dünyasında kimin ölçeklenebileceğini belirleyecek. Günümüzün öncü yapay zeka modellerinin neredeyse tamamı, Uzman Karışımı mimarisi üzerinde çalışmaktadır. Bu tür modelleri verimli bir şekilde hizmete sunmak için GPU alanının boyutu — süper hızlı, ölçeklenebilir bir ara bağlantı ile bağlanan GPU sayısı — önemlidir ve ne kadar büyük olursa o kadar iyidir. NVIDIA Hopper nesli, 8 GPU'lu alan ile standardı belirledi ancak günümüz öncü modellerinin ölçeği bunu aştı. 72 GPU'lu alana sahip bir Uzman Karışımı modelini hizmete sunmak, tam bir kod tasarımı ve bu modellerin gerçek üretim yükü altında işletilmesinden elde edilen operasyonel derinlik gerektirir. NVIDIA Blackwell NVL72 platformu zaten bu temeli sağlayarak, geliri en üst düzeye çıkarmak için en yüksek watt başına performansı ve marjı en üst düzeye çıkarmak için en düşük token maliyetini sunmaktadır. Bu temel üzerine inşa edilen bir sonraki platform olan NVIDIA Vera Rubin, raf seviyesinde enerji verimliliğini daha da artıracaktır. Sonuçlar arasında, NVIDIA GB300 NVL72, önde gelen açık modeller için Hopper nesline kıyasla watt başına 25 kata kadar performans artışı sağlamaktadır. Bu, silikondan yazılıma kadar her seviyede aşırı kod tasarımı ile elde edilir. NVIDIA NVLink Switch, GPU alanlarını ölçeklendirmek için özel olarak oluşturulmuş olup, Vera Rubin platformu ile altıncı neslinde SHARP ağ hesaplamasını desteklemektedir. Yazılım yığını; NVIDIA Dynamo, TensorRT LLM, SGLang ve vLLM'nin yanı sıra NVFP4 nicelemesi, ayrıştırılmış hizmet sunumu (disaggregated serving), uzman paralelliği, KV farkında yönlendirme ve KV önbellek boşaltma optimizasyonlarını içerir. DeepSeek V4 üzerinde watt başına performans bir ayda 5 kat iyileşti. NVIDIA DSX MaxLPS yazılımı, operatörlerin gücü yeniden dağıtarak aynı enerji bütçesi dahilinde %40'a kadar daha fazla GPU çalıştırmasına olanak tanır. Anthropic, OpenAI ve SpaceXAI gibi önde gelen yapay zeka laboratuvarları, çıkarım için NVIDIA Blackwell NVL72'yi kullanmaktadır. CoreWeave, Kimi K2.6'yı NVIDIA GB300 NVL72 üzerinde dağıttı. Perplexity, Qwen3 235B ve Qwen3.5-397B-A17B'yi NVIDIA GB200 NVL72 üzerinde çalıştırmaktadır. Fireworks AI, Cursor ve Factory AI dahil müşteriler için GLM 5.2'yi NVIDIA Blackwell platformunda dağıtmaktadır.
Kaynak: NVIDIA blog — orijinal
Bu konudaki önceki yazılarımız ↓
Güncel haberler