NVIDIA Apresenta Nemotron 3.5 Lightning para Tarefas de Agentes Rápidas e Especializadas
NVIDIA
A NVIDIA expandiu sua família de modelos Nemotron 3 com o Nemotron 3.5 Lightning, um modelo aberto de mistura de especialistas com 30 bilhões de parâmetros, projetado para agentes sempre ativos, oferecendo geração de tokens até 4 vezes mais rápida e 30% mais rápido no tempo de conclusão em comparação com modelos abertos de sua classe. O modelo pode ser ajustado para tarefas personalizadas e roda localmente em várias plataformas NVIDIA. A NVIDIA também introduziu o NeMo Switchyard, uma biblioteca de roteamento de código aberto que otimiza fluxos de trabalho de agentes para precisão, velocidade e custo, reduzindo, segundo relatos, os custos de conclusão de benchmarks para cerca de um terço do uso exclusivo do Opus 4.8.
A NVIDIA anunciou o Nemotron 3.5 Lightning, um modelo aberto personalizável de mistura de especialistas (MoE) com 30 bilhões de parâmetros para agentes sempre ativos, expandindo sua família Nemotron 3. O modelo oferece geração de tokens até 4 vezes mais rápida e 30% mais rápida na conclusão de tarefas em comparação com modelos abertos de sua classe. Como possui pesos abertos, os desenvolvedores podem ajustá-lo para estilos, especialidades ou convenções de codificação específicas, possibilitando experiências personalizadas de IA agêntica local, como gerenciamento de e-mail, rotinas de casa inteligente ou assistentes de codificação. A NVIDIA colaborou com vLLM, Ollama, llama.cpp, LM Studio e Unsloth para fornecer opções otimizadas de implantação local, incluindo formatos NVFP4 e GGUF. O modelo é executado localmente em dispositivos que vão desde PCs NVIDIA RTX e DGX Spark até Jetson, e escala para estações de trabalho e data centers com sistemas Blackwell de parceiros como Acer, ASUS, Dell e Lenovo. Além disso, a NVIDIA apresentou o NeMo Switchyard, uma biblioteca de roteamento de código aberto que direciona cada etapa de um fluxo de trabalho de agente para o modelo mais adequado com base em precisão, velocidade e custo, ajudando empresas a gerenciar custos de tokens. Benchmarks internos mostram que o NeMo Switchyard reduziu os custos de conclusão de benchmarks para aproximadamente um terço do Opus 4.8, mantendo a conclusão de tarefas em nível de fronteira. O NeMo Switchyard está disponível no GitHub.
Fonte: NVIDIA blog —
original
