⚡ ÚLTIMA HORA
NVIDIA Groq 3: SRAM, Desagregação e Determinismo na Nova Plataforma de IA
NVIDIA
Groq
Após adquirir a Groq por 20 bilhões de dólares, a NVIDIA integrou aceleradores LPU na plataforma Vera Rubin, criando uma arquitetura heterogênea para inferência. O novo acelerador de rack Groq 3 LPX, baseado em chips Groq 3 LP30 com 500 MB de SRAM e 150 TB/s de largura de banda de memória, garante execução determinística e baixa latência. A desagregação baseada em fases da decodificação (AFD) permite separar as computações FFN da atenção, distribuindo a carga de trabalho entre GPUs e LPUs.
A NVIDIA concluiu a maior aquisição de sua história, comprando a Groq por US$ 20 bilhões, e integrou aceleradores de IA de arquitetura diferente (LPU) à sua plataforma Vera Rubin, acelerando drasticamente a inferência, tornando-a desagregada e a plataforma heterogênea. O novo acelerador de rack NVIDIA Groq 3 LPX, de 160 kW, contém 256 chips de IA Groq 3 (LP30) com 96 bilhões de transistores cada, agrupados em 32 nós de 1U com resfriamento líquido e design sem cabos MGX. O chip Groq 3 LPU é construído com memória SRAM de 500 MB com largura de banda de 150 TB/s, sem caches ou hierarquia, permitindo movimentação explícita de dados sob controle do compilador. A característica definidora da LPU é o determinismo — ausência de variabilidade em tempo de execução, transferindo todas as decisões para o compilador e usando um protocolo plesiocrono C2C. A inovação chave é a desagregação de fase de decodificação (AFD), que separa o mecanismo de atenção, executado na GPU, das operações FFN/MoE, processadas na LPX. Isso permite que a GPU absorva volumes crescentes de contexto, enquanto a carga na LPU permanece constante e independente do comprimento do contexto. Para uso prático da decodificação heterogênea, o NVIDIA Dynamo fornece orquestração de requisições, distribuição de trabalho e manutenção de latência estável sob tráfego intenso. Em combinação, o Vera Rubin NVL72 com Groq 3 LPX oferece 35 vezes mais throughput em comparação ao Grace Blackwell NVL72 a 400 transações por segundo (TPS) por usuário, e até 10 vezes mais receita por megawatt (MW) para cargas sensíveis à latência.
Fonte: ServerNews —
original
