⚡ ÚLTIMA HORA

NVIDIA Groq 3: SRAM, Desagregação e Determinismo na Nova Plataforma de IA

NVIDIANVIDIA GroqGroq
A aquisição de US$ 20 bilhões da Groq pela NVIDIA resultou na integração dos aceleradores LPU na plataforma Vera Rubin, permitindo inferência de IA desagregada e heterogênea. O novo sistema rack Groq 3 LPX combina 256 LPUs para geração de tokens rápida e determinística, enquanto o Vera Rubin NVL72 lida com treinamento e inferência flexíveis. A plataforma visa aplicações de IA interativa de baixa latência e cargas de trabalho multiagente, prometendo desempenho até 35 vezes mais rápido que o Grace Blackwell NVL72 a 400 TPS por usuário.
A NVIDIA integrou a arquitetura LPU (unidade de processamento de linguagem, do inglês Language Processing Unit) da Groq em sua plataforma de inteligência artificial (IA) Vera Rubin após a aquisição de US$ 20 bilhões. O resultado é um sistema heterogêneo onde a Vera Rubin NVL72 lida com treinamento e inferência gerais, enquanto o acelerador de rack Groq 3 LPX fornece um motor especializado para geração de tokens de baixa latência. O LPX contém 256 chips Groq 3 (LP30) com 96 bilhões de transistores cada, conectados via interconexão RealScale C2C. A LPU é projetada em torno de um modelo de execução determinístico com 500 MB de SRAM por chip (largura de banda de 150 TB/s), sem caches e com movimento explícito de dados controlado por um compilador. Isso elimina instabilidade e garante latência previsível, crucial para sistemas interativos de IA e multiagentes. A plataforma utiliza desagregação de fases (do inglês AFD) separando operações de atenção e FFN (rede feed-forward, do inglês Feed-Forward Network): a GPU lida com preenchimento (prefill) e atenção de contexto longo, enquanto a LPU acelera a decodificação FFN/MoE (mistura de especialistas, do inglês Mixture of Experts). A NVIDIA alega aceleração de até 35 vezes em relação à Grace Blackwell NVL72 a 400 tokens por segundo (TPS) por usuário, e até 10 vezes mais receita por megawatt (MW) para cargas de trabalho sensíveis à latência. O software NVIDIA Dynamo orquestra a decodificação heterogênea, classificando requisições e gerenciando ativações intermediárias.
Fonte: ServerNews — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas