⚡ SON DAKİKA

NVIDIA Groq 3: SRAM, Disaggregation, and Determinism in the New AI Platform

NVIDIANVIDIA GroqGroq
After acquiring Groq for $20 billion, NVIDIA integrated LPU accelerators into the Vera Rubin platform, creating a heterogeneous architecture for inference. The new Groq 3 LPX rack accelerator, based on Groq 3 LP30 chips with 500 MB of SRAM and 150 TB/s memory bandwidth, ensures deterministic execution and low latency. Phase-based disaggregation of decoding (AFD) allows separating FFN computations from attention, distributing the workload between GPUs and LPUs.
NVIDIA, şirket tarihindeki en büyük anlaşmayı tamamlayarak Groq'u 20 milyar dolara satın aldı ve mimari olarak farklı yapay zeka hızlandırıcıları olan LPU'ları Vera Rubin platformuna entegre ederek çıkarımı (inferans) hızlandırdı, böylece çıkarım ayrıştırılmış (dezagregasyon) ve platform heterojen hale geldi. 160 kW gücündeki yeni raf tipi hızlandırıcı NVIDIA Groq 3 LPX, her biri 96 milyar transistör içeren 256 adet Groq 3 (LP30) yapay zeka çipini, sıvı soğutmalı ve kablosuz MGX tasarımına sahip 32 adet 1U yüksekliğindeki düğümde birleştiriyor. Groq 3 LPU çipi, önbelleksiz ve hiyerarşisiz, 150 TB/s bant genişliğine sahip 500 MB SRAM bellek üzerine inşa edilmiş olup, derleyici kontrolünde verinin açıkça taşınmasını sağlıyor. LPU'nun tanımlayıcı özelliği determinizmdir - tüm kararların derleyiciye aktarılması ve plesiyokron C2C protokolü kullanılması sayesinde çalışma zamanında değişkenlik olmaması. Temel yenilik ise Faz Ayrıştırmalı Kod Çözme (AFD - Aligned-Phase Decoupling) olup, GPU'da gerçekleştirilen dikkat mekanizmasını LPX'te işlenen FFN/MoE işlemlerinden ayırıyor. Bu, GPU'nun artan bağlam hacimlerini emmesine olanak tanırken, LPU üzerindeki yükün sabit kalmasını ve bağlam uzunluğundan etkilenmemesini sağlıyor. Heterojen kod çözmenin pratik kullanımı için NVIDIA Dynamo, sorgu orkestrasyonu, iş dağıtımı ve yoğun trafikte sabit gecikmenin korunmasını sağlıyor. Vera Rubin NVL72 ile Groq 3 LPX kombinasyonu, kullanıcı başına 400 TPS'de Grace Blackwell NVL72'ye kıyasla 35 kat daha yüksek işlem hacmi ve gecikmeye duyarlı iş yükleri için MW başına 10 kata kadar daha fazla gelir sağlıyor.
Kaynak: ServerNews — orijinal
Bu konudaki önceki yazılarımız ↓
Güncel haberler