ModelleHardware & Inferenz 🇩🇪 11.08.2026 18:01

Nvidias offenes Nemotron 3.5 Lightning priorisiert Geschwindigkeit vor maximaler Intelligenz

NVIDIANVIDIA OpenAIOpenAI MetaMeta Google/DeepMindGoogle/DeepMind
Nvidia hat Nemotron 3.5 Lightning veröffentlicht, ein kompaktes Modell mit offenen Gewichten, das nur ein Viertel der Parameter besitzt, aber eine ähnliche Intelligenz wie OpenAIs gpt-oss-120b aufweist. Es wird behauptet, dass es extrem schnell ist und in vorläufigen Tests mit finalen NVFP4-Gewichten fast 670 Tokens pro Sekunde erreicht, die höchste Geschwindigkeit unter den verglichenen Modellen.
Nvidia hat Nemotron 3.5 Lightning veröffentlicht, das erste Modell der neuen Nemotron-3.5-Serie. Es ist der direkte Nachfolger von Nemotron 3 Nano 30B A3B und behält die hybride Mamba-Transformer-Architektur dieses Modells bei: 31,6 Milliarden Parameter insgesamt, von denen 3,6 Milliarden aktiv sind. Laut der unabhängigen Benchmarking-Plattform Artificial Analysis erreicht das Modell einen Intelligenzindex von 24, ein Sprung von neun Punkten gegenüber seinem Vorgänger (15). Damit liegt Lightning gleichauf mit OpenAIs gpt-oss-120b (24) und knapp hinter Nvidias eigenem Nemotron 3 Super (26), das etwa viermal so groß ist. Die intelligentesten kleinen Modelle derselben Klasse, wie Qwen3.6 35B A3B (32) oder Metas neues Muse Glimmer (35), bleiben deutlich voraus. Nvidia zielt mit Lightning auf einen anderen Punkt der Effizienzkurve: In vorläufigen Tests mit finalen NVFP4-Gewichten erreicht das Modell fast 670 Token pro Sekunde, der höchste gemessene Wert unter den verglichenen Modellen und fast doppelt so schnell wie Googles Gemini 3.5 Flash-Lite (386 Token/s). Eine Aufgabe aus dem Intelligenzindex dauert damit etwa 0,5 Minuten, während Qwen3.6 35B A3B rund 3,5 Minuten und Gemma 4 31B etwa 5,8 Minuten benötigt. Proprietäre Modelle dominieren weiterhin die gesamte Effizienzkurve: Gemini 3.5 Flash-Lite erreicht einen Intelligenzindex von 37 bei ähnlicher Zeit pro Aufgabe, GPT-5.6 Luna (max) kommt auf 52 Punkte in unter zwei Minuten. Die größten Verbesserungen gibt es laut Artificial Analysis bei den agentischen Fähigkeiten. Im GDPval-AA v2 erreicht Lightning einen Elo-Wert von 824, ein Gewinn von 334 Punkten gegenüber Nemotron 3 Nano, und übertrifft damit sowohl gpt-oss-120b (800) als auch das größere Nemotron 3 Super (698). Im Terminal-Bench v2.1 steigt der Wert von 7 auf 24,3 Prozent, fast auf dem Niveau von gpt-oss-120b (26,2 Prozent). Mit der permissiven OpenMDW-1.1-Lizenz positioniert Nvidia das Modell als effizientes Arbeitstier für Hochdurchsatz-Agentik-Pipelines. Laut Artificial Analysis hat Nvidia mit Partnern wie CodeRabbit und Harvey beim Post-Training zusammengearbeitet, um die Leistung in bestimmten Domänen zu verbessern. Nvidia liefert das Modell in BF16- und NVFP4-Gewichten; die NVFP4-Variante erreicht ebenfalls 24 im Intelligenzindex mit minimaler Verschlechterung gegenüber der höherpräzisen Version. Das Reasoning-Modell verarbeitet nur Text und hat einen Kontextfenster von einer Million Token. Die Gewichte sind sofort verfügbar; Serverless-Inferenz wird von DeepInfra, Fireworks, FriendliAI, CoreWeave, GMI Cloud, Nebius und Crusoe angeboten.
Quelle: The Decoder (DE) — Original
Unsere früheren Beiträge zu diesem Thema ↓
Aktuelle Nachrichten