AMD e Cerebras unem forças para desenvolver plataforma de inferência de IA com latência ultrabaixa

Cerebras SystemsCerebras Systems NVIDIANVIDIA
A AMD e a Cerebras Systems estão criando uma plataforma de computação que combina aceleradores AMD Instinct e chips Cerebras WSE baseados em memória SRAM para inferência de baixa latência de agentes de IA. A solução, disponível na Cerebras Cloud ainda este ano, gera cinco vezes mais tokens por watt e requer menos chips do que sistemas similares de concorrentes.
A AMD e a Cerebras Systems anunciaram o desenvolvimento conjunto de uma plataforma de computação que combina os aceleradores AMD Instinct e os chips Cerebras Wafer Scale Engine (WSE) com memória SRAM integrada. A plataforma é destinada à inferência de agentes de inteligência artificial (IA) — uma etapa que demanda grande quantidade de memória rápida. Segundo o CEO da Cerebras, Andrew Feldman, o projeto preenche uma lacuna no portfólio da AMD, que surgiu após a aquisição da startup Groq pela Nvidia por US$ 20 bilhões. Os chips Cerebras WSE utilizam SRAM em vez de HBM4 (High Bandwidth Memory 4, ou Memória de Alta Largura de Banda 4), o que proporciona uma velocidade de geração superior a 2000 tokens por segundo. No sistema híbrido, as consultas complexas são processadas nos aceleradores AMD Instinct, enquanto a geração de tokens é delegada ao Cerebras WSE, aumentando a eficiência energética em cinco vezes (tokens por watt). Para efeito de comparação: para atender o modelo Kimi K2.5 (1 trilhão de parâmetros), seriam necessários dois mil chips Groq, enquanto no sistema da AMD e Cerebras, apenas algumas dezenas. A solução combinada estará disponível no Cerebras Cloud até o final do ano.
Fonte: 3DNews — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas