⚡ ÚLTIMA HORA

NVIDIA Groq 3: SRAM, desagregación y determinismo en la nueva plataforma de IA

NVIDIANVIDIA GroqGroq
La adquisición de Groq por parte de NVIDIA por 20 mil millones de dólares ha resultado en la integración de los aceleradores LPU en la plataforma Vera Rubin, permitiendo inferencia de IA desagregada y heterogénea. El nuevo sistema rack Groq 3 LPX combina 256 LPUs para una generación de tokens rápida y determinista, mientras que Vera Rubin NVL72 maneja entrenamiento e inferencia flexibles. La plataforma está dirigida a aplicaciones interactivas de baja latencia y cargas de trabajo multiagente, prometiendo un rendimiento hasta 35 veces más rápido que Grace Blackwell NVL72 a 400 TPS por usuario.
NVIDIA ha integrado la arquitectura LPU (Language Processing Unit) de Groq en su plataforma de IA Vera Rubin tras la adquisición por 20 mil millones de dólares. El resultado es un sistema heterogéneo donde Vera Rubin NVL72 maneja el entrenamiento general y la inferencia, mientras que el acelerador de rack Groq 3 LPX proporciona un motor especializado para generación de tokens de baja latencia. LPX contiene 256 chips Groq 3 (LP30) con 96 mil millones de transistores cada uno, conectados mediante la interconexión RealScale C2C. La LPU está diseñada en torno a un modelo de ejecución determinista con 500 MB de SRAM por chip (ancho de banda de 150 TB/s), sin cachés y con movimiento de datos explícito controlado por un compilador. Esto elimina la fluctuación (jitter) y garantiza una latencia predecible, crucial para la IA interactiva y los sistemas multiagente. La plataforma utiliza desagregación de fases (AFD) que separa las operaciones de atención y FFN: la GPU se encarga del prellenado y la atención de contexto largo, mientras que la LPU acelera la decodificación FFN/MoE. NVIDIA afirma una aceleración de hasta 35 veces en comparación con Grace Blackwell NVL72 a 400 TPS por usuario, y hasta 10 veces más ingresos por MW para cargas de trabajo sensibles a la latencia. El software NVIDIA Dynamo orquesta la decodificación heterogénea, clasificando las solicitudes y gestionando las activaciones intermedias.
Fuente: ServerNews — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas