⚡ СРОЧНО
NVIDIA Groq 3: SRAM, дезагрегация и детерминизм в новой ИИ-платформе
NVIDIA
Groq
После приобретения Groq за $20 млрд NVIDIA интегрировала LPU-ускорители в платформу Vera Rubin, создав гетерогенную архитектуру для инференса. Новый стоечный ускоритель Groq 3 LPX на чипах Groq 3 LP30 с 500 Мбайт SRAM и 150 Тбайт/с пропускной способности памяти обеспечивает детерминированное выполнение и низкую задержку, а фазовая дезагрегация декодирования (AFD) позволяет отделить вычисления FFN от внимания, распределяя нагрузку между GPU и LPU.
NVIDIA завершила крупнейшую в своей истории сделку, приобретя Groq за $20 млрд, и интегрировала архитектурно чуждые ИИ-ускорители LPU в свою платформу Vera Rubin, чтобы резко ускорить инференс, сделав его дезагрегированным, а платформу — гетерогенной. Новый стоечный ускоритель NVIDIA Groq 3 LPX мощностью 160 кВт содержит 256 ИИ-чипов Groq 3 (LP30) с 96 млрд транзисторов в каждом, объединённых в
Показать ещё ↓
- Сокращения
- SRAM = Static Random-Access Memory — статическая память с произвольным доступом
- LPU = Language Processing Unit — языковой процессор
- AFD = Attention-FFN Decomposition — декомпозиция внимания и прямого распространения
- FFN = Feed-Forward Network — сеть прямого распространения
- MoE = Mixture of Experts — смесь экспертов
- KV = Key-Value — ключ-значение
- C2C = Chip-to-Chip — чип-к-чипу
- MGX = Modular GPU Baseboard eXchange — модульная замена базовой платы GPU
- TPS = Tokens Per Second — токенов в секунду
Источник: ServerNews —
оригинал
