NVIDIA stellt Nemotron 3.5 Lightning für schnelle, spezialisierte Agentenaufgaben vor
NVIDIA
NVIDIA hat seine Nemotron-3-Modellfamilie um Nemotron 3.5 Lightning erweitert, ein offenes 30B-Mixture-of-Experts-Modell für Dauerbetrieb-Agenten, das bis zu 4-mal schnellere Token-Erzeugung und 30% kürzere Bearbeitungszeit im Vergleich zu offenen Modellen seiner Klasse bietet. Das Modell kann für personalisierte Aufgaben feinabgestimmt werden und läuft lokal auf verschiedenen NVIDIA-Plattformen. NVIDIA stellte außerdem NeMo Switchyard vor, eine Open-Source-Routing-Bibliothek, die Agenten-Workflows hinsichtlich Genauigkeit, Geschwindigkeit und Kosten optimiert und die Benchmark-Abschlusskosten nach eigenen Angaben auf etwa ein Drittel von Opus 4.8 allein senkt.
NVIDIA hat Nemotron 3.5 Lightning angekündigt, ein anpassbares Open-Source-Modell mit 30 Milliarden Parametern im Mixture-of-Experts-Verfahren (MoE) für Always-on-Agenten, und erweitert damit die Nemotron-3-Familie. Das Modell liefert eine bis zu viermal schnellere Token-Erzeugung und eine um 30 Prozent schnellere Fertigstellungszeit im Vergleich zu offenen Modellen seiner Klasse. Da die Gewichte offen sind, können Entwickler es für bestimmte Stile, Spezialgebiete oder Codierungskonventionen feinabstimmen und so personalisierte lokale Agenten-KI-Erlebnisse ermöglichen, etwa für E-Mail-Verwaltung, Smart-Home-Routinen oder Codierungsassistenten. NVIDIA hat mit vLLM, Ollama, llama.cpp, LM Studio und Unsloth zusammengearbeitet, um optimierte lokale Bereitstellungsoptionen einschließlich der Formate NVFP4 und GGUF bereitzustellen. Das Modell läuft lokal auf Geräten von NVIDIA-RTX-PCs und DGX Spark bis hin zu Jetson und skaliert auf Workstations und Rechenzentren mit Blackwell-Systemen von Partnern wie Acer, ASUS, Dell und Lenovo. Zusätzlich hat NVIDIA NeMo Switchyard eingeführt, eine Open-Source-Routing-Bibliothek, die jeden Schritt eines Agenten-Workflows basierend auf Genauigkeit, Geschwindigkeit und Kosten an das am besten geeignete Modell weiterleitet und Unternehmen dabei hilft, Tokens zu verwalten. Interne Benchmarks zeigen, dass NeMo Switchyard die Kosten für die Fertigstellung von Benchmarks auf etwa ein Drittel der Kosten von Opus 4.8 reduziert hat, während die Genauigkeit auf dem Niveau führender Modelle bleibt. NeMo Switchyard ist auf GitHub verfügbar.
Quelle: NVIDIA blog —
Original
