AMD y Cerebras se asocian para desarrollar una plataforma de inferencia de IA de latencia ultrabaja
Cerebras Systems
NVIDIA
AMD se ha asociado con Cerebras Systems para construir una plataforma informática que combina aceleradores AMD Instinct con los chips basados en SRAM de Cerebras para lograr una inferencia de latencia ultrabaja para agentes de IA. La solución conjunta busca llenar un vacío en el portafolio de AMD después de que Nvidia adquiriera Groq por 20 mil millones de dólares en diciembre.
AMD y Cerebras Systems colaboran en una nueva plataforma de inferencia de IA que combina los aceleradores AMD Instinct con los chips Wafer Scale Engine (WSE) de Cerebras, los cuales utilizan memoria SRAM en el chip en lugar de HBM4, lo que permite un acceso a memoria mucho más rápido. Esta alianza cubre un vacío en el portafolio de AMD tras la adquisición de Groq por parte de Nvidia por 20 mil millones de dólares en diciembre. El director ejecutivo de Cerebras, Andrew Feldman, criticó a Nvidia, comparándola con traficantes de armas. El sistema combinado gestiona consultas complejas en los aceleradores AMD Instinct y delega la generación de tokens en el Cerebras WSE, logrando cinco veces más tokens por vatio. Aunque aún no se han revelado métricas específicas, se espera que la solución esté disponible en Cerebras Cloud a finales de este año. La plataforma compite con Vera Rubin de Nvidia emparejada con las LPU de Groq 3, pero AMD y Cerebras afirman que su sistema solo necesita unas pocas decenas de chips para un modelo de un billón de parámetros como Kimi K2.5, mientras que Groq requeriría dos mil chips.
Fuente: 3DNews —
original
