ModellenHardware & Inferentie 🇩🇪 11.08.2026 18:01

Nvidia's open Nemotron 3.5 Lightning geeft prioriteit aan snelheid boven maximale intelligentie

NVIDIANVIDIA OpenAIOpenAI MetaMeta Google/DeepMindGoogle/DeepMind
Nvidia heeft Nemotron 3.5 Lightning uitgebracht, een compact model met open gewichten dat een kwart van de parameters heeft maar vergelijkbare intelligentie biedt als OpenAI's gpt-oss-120b. Het wordt beweerd extreem snel te zijn, met bijna 670 tokens per seconde in voorlopige tests met definitieve NVFP4-gewichten, het hoogste aantal onder vergeleken modellen.
Nvidia heeft Nemotron 3.5 Lightning gelanceerd, het eerste model van de nieuwe Nemotron 3.5-serie. Het is een directe opvolger van Nemotron 3 Nano 30B A3B en behoudt de hybride Mamba-Transformer-architectuur van dat model: in totaal 31,6 miljard parameters, waarvan er 3,6 miljard actief zijn. Volgens het onafhankelijke benchmarkplatform Artificial Analysis behaalt het model een Intelligence Index van 24, een sprong van negen punten ten opzichte van zijn voorganger (15). Hiermee komt Lightning op gelijke hoogte met OpenAI's gpt-oss-120b (24) en net achter Nvidia's eigen Nemotron 3 Super (26), dat ongeveer vier keer zo groot is. De meest intelligente kleine modellen in dezelfde klasse, zoals Qwen3.6 35B A3B (32) of Meta's nieuwe Muse Glimmer (35), blijven duidelijk voor. Nvidia richt Lightning op een ander punt van de efficiëntiegrens: in voorlopige tests met definitieve NVFP4-gewichten haalt het model bijna 670 tokens per seconde, de hoogste gemeten waarde onder vergeleken modellen en bijna twee keer zo snel als Google's Gemini 3.5 Flash-Lite (386 tokens/s). Een taak uit de Intelligence Index duurt daardoor ongeveer 0,5 minuut, terwijl Qwen3.6 35B A3B er ongeveer 3,5 minuten over doet en Gemma 4 31B ongeveer 5,8 minuten. Propriëtaire modellen blijven de algehele efficiëntiegrens domineren: Gemini 3.5 Flash-Lite behaalt een Intelligence Index van 37 met een vergelijkbare tijd per taak, GPT-5.6 Luna (max) komt tot 52 punten in minder dan twee minuten. De grootste verbeteringen zijn te zien in agentische capaciteiten, aldus Artificial Analysis. In GDPval-AA v2 behaalt Lightning een Elo-score van 824, een winst van 334 punten ten opzichte van Nemotron 3 Nano, waarmee het zowel gpt-oss-120b (800) als het grotere Nemotron 3 Super (698) overtreft. In Terminal-Bench v2.1 stijgt de score van 7 naar 24,3 procent, bijna op het niveau van gpt-oss-120b (26,2 procent). Met de permissieve OpenMDW-1.1-licentie positioneert Nvidia het model als een efficiënt werkpaard voor hoogwaardige agentische pipelines. Volgens Artificial Analysis werkte Nvidia samen met partners als CodeRabbit en Harvey aan post-training om de prestaties in specifieke domeinen te verbeteren. Nvidia levert het model in BF16- en NVFP4-gewichten; de NVFP4-variant scoort ook 24 op de Intelligence Index met minimale degradatie ten opzichte van de hogeprecisieversie. Het redeneringsmodel verwerkt alleen tekst en heeft een contextvenster van één miljoen tokens. De gewichten zijn onmiddellijk beschikbaar; serverless inferentie wordt aangeboden door DeepInfra, Fireworks, FriendliAI, CoreWeave, GMI Cloud, Nebius en Crusoe.
Bron: The Decoder (DE) — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws