AMD e Cerebras se unem para desenvolver plataforma de inferência de IA com latência ultrabaixa

Cerebras SystemsCerebras Systems NVIDIANVIDIA
A AMD fez uma parceria com a Cerebras Systems para construir uma plataforma de computação que combina aceleradores AMD Instinct com os chips baseados em SRAM da Cerebras, visando alcançar inferência de latência ultrabaixa para agentes de IA. A solução conjunta busca preencher uma lacuna no portfólio da AMD após a Nvidia adquirir a Groq por 20 bilhões de dólares em dezembro.
A AMD e a Cerebras Systems estão colaborando em uma nova plataforma de inferência de IA que combina os aceleradores AMD Instinct com os chips Wafer Scale Engine (WSE) da Cerebras, que utilizam memória SRAM on-chip em vez de HBM4, permitindo acesso à memória muito mais rápido. A parceria preenche uma lacuna no portfólio da AMD após a aquisição de US$ 20 bilhões da Groq pela Nvidia em dezembro. O CEO da Cerebras, Andrew Feldman, criticou a Nvidia, comparando-a a traficantes de armas. O sistema combinado lida com consultas complexas nos aceleradores AMD Instinct e delega a geração de tokens ao WSE da Cerebras, alcançando cinco vezes mais tokens por watt. Embora métricas específicas ainda não tenham sido divulgadas, espera-se que a solução esteja disponível no Cerebras Cloud ainda este ano. A plataforma compete com a Vera Rubin da Nvidia emparelhada com as LPUs da Groq 3, mas a AMD e a Cerebras afirmam que seu sistema requer apenas algumas dezenas de chips para um modelo de 1 trilhão de parâmetros como o Kimi K2.5, enquanto a Groq precisaria de dois mil chips.
Fonte: 3DNews — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas