AMD et Cerebras s'associent pour développer une plateforme d'inférence IA à ultra-faible latence
Cerebras Systems
NVIDIA
AMD s'est associé à Cerebras Systems pour construire une plateforme de calcul combinant les accélérateurs AMD Instinct avec les puces SRAM de Cerebras afin d'obtenir une inférence à ultra-faible latence pour les agents IA. Cette solution conjointe vise à combler une lacune dans le portefeuille d'AMD après l'acquisition de Groq par Nvidia pour 20 milliards de dollars en décembre.
AMD et Cerebras Systems collaborent sur une nouvelle plateforme d'inférence IA qui associe les accélérateurs AMD Instinct aux puces Wafer Scale Engine (WSE) de Cerebras, lesquelles utilisent une mémoire SRAM sur puce plutôt que de la HBM4, permettant un accès mémoire bien plus rapide. Ce partenariat comble un vide dans le portefeuille d'AMD après l'acquisition de Groq par Nvidia pour 20 milliards de dollars en décembre. Andrew Feldman, PDG de Cerebras, a critiqué Nvidia en la comparant à des marchands d'armes. Le système combiné traite les requêtes complexes sur les accélérateurs AMD Instinct et délègue la génération de tokens aux puces Cerebras WSE, atteignant cinq fois plus de tokens par watt. Bien que les métriques spécifiques n'aient pas encore été divulguées, la solution devrait être disponible dans le cloud Cerebras plus tard cette année. La plateforme concurrence le système Vera Rubin de Nvidia associé aux LPU de Groq 3, mais AMD et Cerebras affirment que leur système ne nécessite que quelques dizaines de puces pour un modèle à 1 000 milliards de paramètres comme Kimi K2.5, alors que Groq en nécessiterait deux mille.
Source: 3DNews —
original
