⚡ ÚLTIMA HORA

NVIDIA Groq 3: SRAM, desagregación y determinismo en la nueva plataforma de IA

NVIDIANVIDIA GroqGroq
Tras adquirir Groq por 20 mil millones de dólares, NVIDIA integró los aceleradores LPU en la plataforma Vera Rubin, creando una arquitectura heterogénea para inferencia. El nuevo acelerador LPX de rack Groq 3, basado en chips Groq 3 LP30 con 500 MB de SRAM y 150 TB/s de ancho de banda de memoria, garantiza ejecución determinista y baja latencia. La desagregación por fases de la decodificación (AFD) permite separar los cálculos FFN de la atención, distribuyendo la carga de trabajo entre GPU y LPU.
NVIDIA ha completado la mayor adquisición de su historia, comprando Groq por 20 mil millones de dólares, e integrado los aceleradores de IA LPU, arquitectónicamente heterogéneos, en su plataforma Vera Rubin para acelerar drásticamente la inferencia, haciéndola desagregada y la plataforma heterogénea. El nuevo acelerador de rack NVIDIA Groq 3 LPX, de 160 kW, contiene 256 chips de IA Groq 3 (LP30) con 96 mil millones de transistores cada uno, agrupados en 32 nodos de 1U con refrigeración líquida y diseño sin cables MGX. El chip Groq 3 LPU está construido con memoria SRAM de 500 MB con un ancho de banda de 150 TB/s, sin cachés ni jerarquía, lo que permite mover datos explícitamente bajo el control del compilador. La característica definitoria de la LPU es el determinismo: ausencia de variabilidad en tiempo de ejecución al trasladar todas las decisiones al compilador y utilizar el protocolo C2C plesiócrono. La innovación clave es la desagregación por fases de la decodificación (AFD), que separa el mecanismo de atención, ejecutado en la GPU, de las operaciones FFN/MoE, procesadas en la LPX. Esto permite que la GPU absorba volúmenes crecientes de contexto, mientras que la carga en la LPU permanece constante independientemente de la longitud del contexto. Para el uso práctico de la decodificación heterogénea, NVIDIA Dynamo proporciona orquestación de solicitudes, distribución de trabajo y mantenimiento de una latencia estable bajo tráfico intenso. En combinación, Vera Rubin NVL72 con Groq 3 LPX ofrece un rendimiento 35 veces superior en comparación con Grace Blackwell NVL72 a 400 transacciones por segundo (TPS) por usuario, y hasta 10 veces más ingresos por megavatio para cargas de trabajo sensibles a la latencia.
Fuente: ServerNews — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas