NVIDIA introduceert Nemotron 3.5 Lightning voor snelle, gespecialiseerde agentische taken
NVIDIA
NVIDIA heeft zijn Nemotron 3-modelfamilie uitgebreid met Nemotron 3.5 Lightning, een open 30B-mixture-of-experts-model dat is ontworpen voor altijd-actieve agents en tot 4x snellere tokengeneratie en 30% snellere tijd tot voltooiing biedt in vergelijking met open modellen in zijn klasse. Het model kan worden verfijnd voor gepersonaliseerde taken en draait lokaal op verschillende NVIDIA-platforms. NVIDIA introduceerde ook NeMo Switchyard, een open-source routeringsbibliotheek die agentworkflows optimaliseert voor nauwkeurigheid, snelheid en kosten, en de benchmarkkosten naar verluidt verlaagt tot ongeveer een derde van Opus 4.8 alleen.
NVIDIA heeft Nemotron 3.5 Lightning aangekondigd, een aanpasbaar open 30B mixture-of-experts (MoE)-model voor always-on agents, waarmee het Nemotron 3-familie wordt uitgebreid. Het model levert tot 4x snellere token-generatie en 30% snellere tijd tot voltooiing in vergelijking met open modellen in zijn klasse. Omdat het open gewichten heeft, kunnen ontwikkelaars het verfijnen voor specifieke stijlen, specialisaties of codeerconventies, waardoor gepersonaliseerde lokale agentische AI-ervaringen mogelijk worden, zoals e-mailbeheer, smart home-routines of codeerassistenten. NVIDIA heeft samengewerkt met vLLM, Ollama, llama.cpp, LM Studio en Unsloth om geoptimaliseerde lokale implementatie-opties te bieden, waaronder NVFP4- en GGUF-formaten. Het model draait lokaal op apparaten variërend van NVIDIA RTX-pc's en DGX Spark tot Jetson, en schaalt naar werkstations en datacenters met Blackwell-systemen van partners zoals Acer, ASUS, Dell en Lenovo. Daarnaast introduceerde NVIDIA NeMo Switchyard, een open-source routeringsbibliotheek die elke stap van een agent-workflow naar het best passende model stuurt op basis van nauwkeurigheid, snelheid en kosten, waardoor bedrijven hun tokenkosten kunnen beheren. Interne benchmarks tonen aan dat NeMo Switchyard de benchmarkvoltooiingskosten tot ongeveer een derde van Opus 4.8 reduceerde, terwijl de taakvoltooiing op frontniveau behouden bleef. NeMo Switchyard is beschikbaar op GitHub.
Bron: NVIDIA blog —
origineel
