ModelPerangkat Keras & Inferensi 🇩🇪 11.08.2026 18:01

Nemotron 3.5 Lightning Terbuka dari Nvidia Memprioritaskan Kecepatan daripada Kecerdasan Maksimal

NVIDIANVIDIA OpenAIOpenAI MetaMeta Google/DeepMindGoogle/DeepMind
Nvidia telah merilis Nemotron 3.5 Lightning, model open-weights yang ringkas dengan seperempat parameter tetapi kecerdasan serupa dengan gpt-oss-120b dari OpenAI. Model ini diklaim sangat cepat, mencapai hampir 670 token per detik dalam pengujian awal dengan bobot final NVFP4, yang tertinggi di antara model yang dibandingkan.
Nvidia telah meluncurkan Nemotron 3.5 Lightning, model pertama dari seri Nemotron 3.5 yang baru. Model ini merupakan penerus langsung dari Nemotron 3 Nano 30B A3B dan mempertahankan arsitektur hibrida Mamba-Transformer dari model tersebut: total 31,6 miliar parameter, dengan 3,6 miliar parameter aktif. Menurut platform benchmarking independen Artificial Analysis, model ini mencapai Indeks Kecerdasan 24, naik sembilan poin dibanding pendahulunya (15). Ini menempatkan Lightning sejajar dengan gpt-oss-120b milik OpenAI (24) dan hanya sedikit di belakang Nemotron 3 Super milik Nvidia sendiri (26), yang ukurannya sekitar empat kali lebih besar. Model kecil paling cerdas di kelas yang sama, seperti Qwen3.6 35B A3B (32) atau Muse Glimmer baru dari Meta (35), tetap unggul jelas. Nvidia menyasar Lightning pada titik yang berbeda di frontier efisiensi: dalam pengujian awal dengan bobot NVFP4 final, model ini mencapai hampir 670 token per detik, nilai tertinggi yang diukur di antara model yang dibandingkan dan hampir dua kali lebih cepat dari Gemini 3.5 Flash-Lite milik Google (386 token/detik). Dengan demikian, satu tugas dari Indeks Kecerdasan memakan waktu sekitar 0,5 menit, sementara Qwen3.6 35B A3B memakan sekitar 3,5 menit dan Gemma 4 31B sekitar 5,8 menit. Model kepemilikan terus mendominasi frontier efisiensi secara keseluruhan: Gemini 3.5 Flash-Lite mencapai Indeks Kecerdasan 37 dengan waktu per tugas yang serupa, GPT-5.6 Luna (maks) mencapai 52 poin dalam waktu kurang dari dua menit. Perbaikan terbesar terlihat pada kemampuan agen (agentic), menurut Artificial Analysis. Dalam GDPval-AA v2, Lightning mencapai skor Elo 824, naik 334 poin dibanding Nemotron 3 Nano, melampaui gpt-oss-120b (800) dan Nemotron 3 Super (698) yang lebih besar. Dalam Terminal-Bench v2.1, skor naik dari 7 menjadi 24,3 persen, hampir setara dengan gpt-oss-120b (26,2 persen). Dengan lisensi OpenMDW-1.1 yang permisif, Nvidia memposisikan model ini sebagai kuda kerja yang efisien untuk pipeline agen berthroughput tinggi. Menurut Artificial Analysis, Nvidia bekerja sama dengan mitra seperti CodeRabbit dan Harvey dalam post-training untuk meningkatkan kinerja di domain tertentu. Nvidia menyediakan model ini dalam bobot BF16 dan NVFP4; varian NVFP4 juga mencetak 24 pada Indeks Kecerdasan dengan penurunan minimal dibanding versi presisi lebih tinggi. Model penalaran ini hanya memproses teks dan memiliki jendela konteks satu juta token. Bobot tersedia segera; inferensi serverless ditawarkan oleh DeepInfra, Fireworks, FriendliAI, CoreWeave, GMI Cloud, Nebius, dan Crusoe.
Sumber: The Decoder (DE) — asli
Postingan kami sebelumnya tentang topik ini ↓
Berita terbaru