NVIDIA Memperkenalkan Nemotron 3.5 Lightning untuk Tugas Agen yang Cepat dan Spesifik
NVIDIA
NVIDIA telah memperluas keluarga model Nemotron 3 dengan Nemotron 3.5 Lightning, model open-source dengan arsitektur mixture-of-experts (MoE) 30B yang dirancang untuk agen yang selalu aktif, menawarkan pembuatan token hingga 4 kali lebih cepat dan waktu penyelesaian 30% lebih cepat dibandingkan model open-source lain di kelasnya. Model ini dapat di-fine-tune untuk tugas yang dipersonalisasi dan berjalan secara lokal di berbagai platform NVIDIA. NVIDIA juga memperkenalkan NeMo Switchyard, pustaka routing open-source yang mengoptimalkan alur kerja agen untuk akurasi, kecepatan, dan biaya, yang dilaporkan mengurangi biaya penyelesaian benchmark menjadi sekitar sepertiga dari biaya penggunaan Opus 4.8 saja.
NVIDIA telah mengumumkan Nemotron 3.5 Lightning, sebuah model mixture-of-experts (MoE) terbuka 30B yang dapat disesuaikan untuk agen yang selalu aktif, memperluas keluarga Nemotron 3. Model ini memberikan kecepatan pembuatan token hingga 4x lebih cepat dan waktu penyelesaian 30% lebih cepat dibandingkan model terbuka sejenisnya. Karena bobotnya terbuka, pengembang dapat melakukan penyesuaian halus untuk gaya, spesialisasi, atau konvensi kode tertentu, sehingga memungkinkan pengalaman AI agen lokal yang personal seperti manajemen email, rutinitas rumah pintar, atau pendamping pengkodean. NVIDIA berkolaborasi dengan vLLM, Ollama, llama.cpp, LM Studio, dan Unsloth untuk menyediakan opsi penerapan lokal yang dioptimalkan, termasuk format NVFP4 dan GGUF. Model ini berjalan secara lokal pada perangkat mulai dari PC NVIDIA RTX dan DGX Spark hingga Jetson, dan dapat diskalakan ke stasiun kerja serta pusat data dengan sistem Blackwell dari mitra seperti Acer, ASUS, Dell, dan Lenovo. Selain itu, NVIDIA memperkenalkan NeMo Switchyard, sebuah pustaka perutean sumber terbuka yang mengarahkan setiap langkah alur kerja agen ke model yang paling sesuai berdasarkan akurasi, kecepatan, dan biaya, membantu perusahaan mengelola biaya token. Tolok ukur internal menunjukkan NeMo Switchyard mengurangi biaya penyelesaian tolok ukur menjadi sekitar sepertiga dari Opus 4.8 sambil mempertahankan penyelesaian tugas tingkat tertinggi. NeMo Switchyard tersedia di GitHub.
Sumber: NVIDIA blog —
asli
