⚡ СРОЧНО

NVIDIA Groq 3: SRAM, дезагрегация и детерминизм в новой ИИ-платформе

NVIDIANVIDIA GroqGroq
После приобретения Groq за $20 млрд NVIDIA интегрировала LPU-ускорители в платформу Vera Rubin, создав гетерогенную архитектуру для инференса. Новый стоечный ускоритель Groq 3 LPX на чипах Groq 3 LP30 с 500 Мбайт SRAM и 150 Тбайт/с пропускной способности памяти обеспечивает детерминированное выполнение и низкую задержку, а фазовая дезагрегация декодирования (AFD) позволяет отделить вычисления FFN от внимания, распределяя нагрузку между GPU и LPU.
NVIDIA завершила крупнейшую в своей истории сделку, приобретя Groq за $20 млрд, и интегрировала архитектурно чуждые ИИ-ускорители LPU в свою платформу Vera Rubin, чтобы резко ускорить инференс, сделав его дезагрегированным, а платформу — гетерогенной. Новый стоечный ускоритель NVIDIA Groq 3 LPX мощностью 160 кВт содержит 256 ИИ-чипов Groq 3 (LP30) с 96 млрд транзисторов в каждом, объединённых в
Показать ещё ↓
Сокращения
SRAM = Static Random-Access Memory — статическая память с произвольным доступом
LPU = Language Processing Unit — языковой процессор
AFD = Attention-FFN Decomposition — декомпозиция внимания и прямого распространения
FFN = Feed-Forward Network — сеть прямого распространения
MoE = Mixture of Experts — смесь экспертов
KV = Key-Value — ключ-значение
C2C = Chip-to-Chip — чип-к-чипу
MGX = Modular GPU Baseboard eXchange — модульная замена базовой платы GPU
TPS = Tokens Per Second — токенов в секунду
Источник: ServerNews — оригинал
Наши предыдущие публикации по теме ↓
Свежие новости