⚡ SON DAKİKA

NVIDIA Groq 3: Yeni Yapay Zeka Platformunda SRAM, Ayrıştırma ve Determinizm

NVIDIANVIDIA GroqGroq
NVIDIA'nın 20 milyar dolarlık Groq satın alması, LPU hızlandırıcılarının Vera Rubin platformuna entegre edilmesiyle sonuçlanarak ayrıştırılmış, heterojen yapay zeka çıkarımı sağladı. Yeni Groq 3 LPX raf sistemi, hızlı, deterministik token oluşturma için 256 LPU'yu birleştirirken, Vera Rubin NVL72 esnek eğitim ve çıkarımı yönetiyor. Platform, düşük gecikmeli etkileşimli yapay zeka ve çoklu etmen iş yüklerini hedefleyerek, kullanıcı başına 400 TPS'de Grace Blackwell NVL72'den 35 kata kadar daha hızlı performans vaat ediyor.
NVIDIA, 20 milyar dolarlık satın almanın ardından Groq'un LPU (Dil İşleme Birimi) mimarisini Vera Rubin AI platformuna entegre etti. Sonuç, Vera Rubin NVL72'nin genel eğitim ve çıkarım işlemlerini üstlendiği, Groq 3 LPX raf hızlandırıcısının ise düşük gecikmeli token üretimi için özel bir motor sağladığı heterojen bir sistem oldu. LPX, her biri 96 milyar transistör içeren 256 adet Groq 3 (LP30) çipini RealScale C2C bağlantısı aracılığıyla birbirine bağlıyor. LPU, deterministik bir yürütme modeli etrafında tasarlanmış olup çip başına 500 MB SRAM (150 TB/s bant genişliği), önbellek yok ve bir derleyici tarafından kontrol edilen açık veri hareketi içerir. Bu, titreşimi ortadan kaldırır ve öngörülebilir gecikme süresi sağlayarak etkileşimli yapay zeka ve çoklu etmen sistemleri için kritik öneme sahiptir. Platform, dikkat ve FFN işlemlerini ayıran aşama ayrıştırmasını (AFD) kullanır: GPU, ön doldurma ve uzun bağlam dikkat işlemlerini yürütürken, LPU FFN/MoE kod çözmeyi hızlandırır. NVIDIA, Grace Blackwell NVL72'ye kıyasla kullanıcı başına 400 TPS'de 35 kata kadar hızlanma ve gecikmeye duyarlı iş yükleri için MW başına 10 kata kadar daha fazla gelir elde edildiğini iddia ediyor. NVIDIA Dynamo yazılımı, heterojen kod çözmeyi düzenler, istekleri sınıflandırır ve ara etkinleştirmeleri yönetir.
Kaynak: ServerNews — orijinal
Bu konudaki önceki yazılarımız ↓
Güncel haberler