ModèlesMatériel et Inférence 🇩🇪 11.08.2026 18:01

Le Nemotron 3.5 Lightning open source de Nvidia privilégie la vitesse à l'intelligence maximale

NVIDIANVIDIA OpenAIOpenAI MetaMeta Google/DeepMindGoogle/DeepMind
Nvidia a publié Nemotron 3.5 Lightning, un modèle open source compact avec un quart des paramètres mais une intelligence similaire à celle de OpenAI gpt-oss-120b. Il est annoncé comme extrêmement rapide, atteignant près de 670 tokens par seconde dans des tests préliminaires avec les poids finaux NVFP4, le plus élevé parmi les modèles comparés.
Nvidia a lancé Nemotron 3.5 Lightning, le premier modèle de sa nouvelle série Nemotron 3.5. Il succède directement à Nemotron 3 Nano 30B A3B et conserve l'architecture hybride Mamba-Transformer de ce modèle : 31,6 milliards de paramètres au total, dont 3,6 milliards actifs. Selon la plateforme d'évaluation indépendante Artificial Analysis, le modèle atteint un indice d'intelligence de 24, soit un bond de neuf points par rapport à son prédécesseur (15). Cela place Lightning au niveau de gpt-oss-120b d'OpenAI (24) et juste derrière le propre Nemotron 3 Super de Nvidia (26), qui est environ quatre fois plus grand. Les petits modèles les plus intelligents de la même catégorie, comme Qwen3.6 35B A3B (32) ou le nouveau Muse Glimmer de Meta (35), restent clairement en tête. Nvidia vise avec Lightning un autre point de la frontière d'efficacité : lors de tests préliminaires avec les poids finaux NVFP4, le modèle atteint près de 670 tokens par seconde, la valeur la plus élevée mesurée parmi les modèles comparés, et presque deux fois plus rapide que Google Gemini 3.5 Flash-Lite (386 tokens/s). Une tâche de l'indice d'intelligence prend ainsi environ 0,5 minute, tandis que Qwen3.6 35B A3B prend environ 3,5 minutes et Gemma 4 31B environ 5,8 minutes. Les modèles propriétaires continuent de dominer la frontière d'efficacité globale : Gemini 3.5 Flash-Lite atteint un indice d'intelligence de 37 avec un temps par tâche similaire, GPT-5.6 Luna (max) atteint 52 points en moins de deux minutes. Les plus grandes améliorations concernent les capacités agentiques, selon Artificial Analysis. Dans GDPval-AA v2, Lightning obtient un score Elo de 824, soit un gain de 334 points par rapport à Nemotron 3 Nano, dépassant à la fois gpt-oss-120b (800) et le plus grand Nemotron 3 Super (698). Dans Terminal-Bench v2.1, le score passe de 7 à 24,3 %, presque au niveau de gpt-oss-120b (26,2 %). Avec la licence permissive OpenMDW-1.1, Nvidia positionne le modèle comme un cheval de trait efficace pour les pipelines agentiques à haut débit. Selon Artificial Analysis, Nvidia a travaillé avec des partenaires comme CodeRabbit et Harvey sur le post-entraînement pour améliorer les performances dans des domaines spécifiques. Nvidia livre le modèle en poids BF16 et NVFP4 ; la variante NVFP4 obtient également un score de 24 sur l'indice d'intelligence avec une dégradation minimale par rapport à la version en haute précision. Le modèle de raisonnement traite uniquement du texte et a une fenêtre de contexte d'un million de tokens. Les poids sont disponibles immédiatement ; l'inférence sans serveur est proposée par DeepInfra, Fireworks, FriendliAI, CoreWeave, GMI Cloud, Nebius et Crusoe.
Source: The Decoder (DE) — original
Nos articles précédents sur ce sujet ↓
Infos fraîches