ModelosHardware e Inferência 🇩🇪 11.08.2026 18:01

O Nemotron 3.5 Lightning aberto da Nvidia prioriza a velocidade em vez da inteligência máxima

NVIDIANVIDIA OpenAIOpenAI MetaMeta Google/DeepMindGoogle/DeepMind
A Nvidia lançou o Nemotron 3.5 Lightning, um modelo compacto de pesos abertos com um quarto dos parâmetros, mas com inteligência semelhante à do gpt-oss-120b da OpenAI. Alega-se que é extremamente rápido, alcançando quase 670 tokens por segundo em testes preliminares com os pesos finais NVFP4, o maior entre os modelos comparados.
A Nvidia lançou o Nemotron 3.5 Lightning, o primeiro modelo da nova série Nemotron 3.5. Ele é o sucessor direto do Nemotron 3 Nano 30B A3B e mantém a arquitetura híbrida Mamba-Transformer desse modelo: 31,6 bilhões de parâmetros no total, dos quais 3,6 bilhões são ativos. De acordo com a plataforma independente de benchmarks Artificial Analysis, o modelo alcança um Índice de Inteligência de 24, um salto de nove pontos em relação ao seu antecessor (15). Isso coloca o Lightning no mesmo nível do gpt-oss-120b da OpenAI (24) e logo atrás do próprio Nemotron 3 Super da Nvidia (26), que é cerca de quatro vezes maior. Os pequenos modelos mais inteligentes da mesma classe, como Qwen3.6 35B A3B (32) ou o novo Muse Glimmer da Meta (35), continuam claramente à frente. A Nvidia visa com o Lightning um ponto diferente na fronteira de eficiência: em testes preliminares com pesos finais NVFP4, o modelo atinge quase 670 tokens por segundo, o valor mais alto medido entre os modelos comparados e quase duas vezes mais rápido que o Gemini 3.5 Flash-Lite do Google (386 tokens/s). Uma tarefa do Índice de Inteligência leva cerca de 0,5 minutos, enquanto o Qwen3.6 35B A3B leva cerca de 3,5 minutos e o Gemma 4 31B cerca de 5,8 minutos. Os modelos proprietários continuam dominando a fronteira geral de eficiência: o Gemini 3.5 Flash-Lite alcança um Índice de Inteligência de 37 com tempo semelhante por tarefa, o GPT-5.6 Luna (max) chega a 52 pontos em menos de dois minutos. As maiores melhorias são vistas nas capacidades agênticas, segundo a Artificial Analysis. No GDPval-AA v2, o Lightning alcança uma pontuação Elo de 824, um ganho de 334 pontos sobre o Nemotron 3 Nano, superando tanto o gpt-oss-120b (800) quanto o Nemotron 3 Super, maior (698). No Terminal-Bench v2.1, a pontuação sobe de 7 para 24,3 por cento, quase no nível do gpt-oss-120b (26,2 por cento). Com a licença permissiva OpenMDW-1.1, a Nvidia posiciona o modelo como um cavalo de batalha eficiente para pipelines agênticos de alto rendimento. De acordo com a Artificial Analysis, a Nvidia trabalhou com parceiros como CodeRabbit e Harvey no pós-treinamento para melhorar o desempenho em domínios específicos. A Nvidia entrega o modelo em pesos BF16 e NVFP4; a variante NVFP4 também pontua 24 no Índice de Inteligência com degradação mínima em relação à versão de maior precisão. O modelo de raciocínio processa apenas texto e tem uma janela de contexto de um milhão de tokens. Os pesos estão disponíveis imediatamente; a inferência sem servidor é oferecida por DeepInfra, Fireworks, FriendliAI, CoreWeave, GMI Cloud, Nebius e Crusoe.
Fonte: The Decoder (DE) — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas