NVIDIA présente Nemotron 3.5 Lightning pour des tâches d'agent rapides et spécialisées
NVIDIA
NVIDIA a élargi sa famille de modèles Nemotron 3 avec Nemotron 3.5 Lightning, un modèle ouvert de 30B à mélange d'experts conçu pour des agents toujours actifs, offrant jusqu'à 4 fois plus de rapidité dans la génération de jetons et 30% plus rapide en temps de complétion par rapport aux modèles ouverts de sa catégorie. Le modèle peut être affiné pour des tâches personnalisées et fonctionne localement sur diverses plateformes NVIDIA. NVIDIA a également présenté NeMo Switchyard, une bibliothèque de routage open source qui optimise les flux de travail d'agent pour la précision, la rapidité et le coût, réduisant prétendument les coûts de complétion de benchmark à environ un tiers de ceux d'Opus 4.8 seul.
NVIDIA a annoncé Nemotron 3.5 Lightning, un modèle open source personnalisable de 30 milliards de paramètres à architecture mixte d'experts (MoE) pour agents toujours actifs, élargissant ainsi sa famille Nemotron 3. Le modèle génère des tokens jusqu'à 4 fois plus rapidement et termine les tâches 30% plus vite que les modèles ouverts de sa catégorie. Grâce à ses poids ouverts, les développeurs peuvent l'affiner pour des styles, spécialités ou conventions de codage spécifiques, permettant des expériences d'IA agentique locales personnalisées telles que la gestion des e-mails, les routines de maison intelligente ou les compagnons de codage. NVIDIA a collaboré avec vLLM, Ollama, llama.cpp, LM Studio et Unsloth pour proposer des options de déploiement local optimisées, notamment les formats NVFP4 et GGUF. Le modèle fonctionne localement sur des appareils allant des PC NVIDIA RTX et DGX Spark à Jetson, et s'étend aux postes de travail et centres de données avec les systèmes Blackwell de partenaires comme Acer, ASUS, Dell et Lenovo. De plus, NVIDIA a introduit NeMo Switchyard, une bibliothèque de routage open source qui dirige chaque étape d'un flux de travail d'agent vers le modèle le plus adapté en fonction de la précision, de la vitesse et du coût, aidant les entreprises à gérer les coûts de tokens. Les benchmarks internes montrent que NeMo Switchyard a réduit les coûts de complétion de benchmark à environ un tiers de ceux d'Opus 4.8 tout en maintenant un niveau de complétion de tâches de pointe. NeMo Switchyard est disponible sur GitHub.
Source: NVIDIA blog —
original
