NVIDIA presenta Nemotron 3.5 Lightning para tareas agénticas rápidas y especializadas
NVIDIA
NVIDIA ha ampliado su familia de modelos Nemotron 3 con Nemotron 3.5 Lightning, un modelo abierto de 30B de mezcla de expertos diseñado para agentes siempre activos, que ofrece hasta 4 veces más rapidez en la generación de tokens y un 30% más de velocidad en el tiempo de finalización en comparación con modelos abiertos de su clase. El modelo se puede ajustar para tareas personalizadas y se ejecuta localmente en varias plataformas de NVIDIA. NVIDIA también presentó NeMo Switchyard, una biblioteca de enrutamiento de código abierto que optimiza los flujos de trabajo de los agentes en términos de precisión, velocidad y costo, y se informa que reduce los costos de finalización de benchmarks a aproximadamente un tercio de Opus 4.8 solo.
NVIDIA ha anunciado Nemotron 3.5 Lightning, un modelo personalizable de código abierto de 30B con mezcla de expertos (MoE) para agentes siempre activos, ampliando su familia Nemotron 3. El modelo ofrece una generación de tokens hasta 4 veces más rápida y un 30% más rápido de tiempo de finalización en comparación con modelos abiertos de su clase. Debido a que tiene pesos abiertos, los desarrolladores pueden ajustarlo para estilos, especialidades o convenciones de codificación específicas, lo que permite experiencias de IA agéntica local y personalizada, como gestión de correos electrónicos, rutinas de hogar inteligente o asistentes de codificación. NVIDIA colaboró con vLLM, Ollama, llama.cpp, LM Studio y Unsloth para proporcionar opciones de implementación local optimizadas, incluidos los formatos NVFP4 y GGUF. El modelo se ejecuta localmente en dispositivos que van desde PC NVIDIA RTX y DGX Spark hasta Jetson, y escala a estaciones de trabajo y centros de datos con sistemas Blackwell de socios como Acer, ASUS, Dell y Lenovo. Además, NVIDIA presentó NeMo Switchyard, una biblioteca de enrutamiento de código abierto que dirige cada paso de un flujo de trabajo de agente al modelo más adecuado según precisión, velocidad y costo, ayudando a las empresas a gestionar los costos de tokens. Los puntos de referencia internos muestran que NeMo Switchyard redujo los costos de finalización de puntos de referencia a aproximadamente un tercio de Opus 4.8, manteniendo la finalización de tareas de nivel fronterizo. NeMo Switchyard está disponible en GitHub.
Fuente: NVIDIA blog —
original
