Mô hìnhPhần cứng & Suy luận 🇩🇪 11.08.2026 18:01

Nvidia công bố Nemotron 3.5 Lightning mã nguồn mở ưu tiên tốc độ hơn trí tuệ tối đa

NVIDIANVIDIA OpenAIOpenAI MetaMeta Google/DeepMindGoogle/DeepMind
Nvidia đã phát hành Nemotron 3.5 Lightning, một mô hình mã nguồn mở nhỏ gọn với chỉ một phần tư tham số nhưng có trí tuệ tương đương với gpt-oss-120b của OpenAI. Mô hình này được tuyên bố là cực kỳ nhanh, đạt gần 670 token mỗi giây trong các bài kiểm tra sơ bộ với trọng số NVFP4 cuối cùng, cao nhất trong số các mô hình được so sánh.
Nvidia đã phát hành Nemotron 3.5 Lightning, mô hình đầu tiên trong chuỗi Nemotron 3.5 mới của hãng. Đây là bản kế thừa trực tiếp của Nemotron 3 Nano 30B A3B và giữ nguyên kiến trúc lai Mamba-Transformer của mô hình đó: tổng số tham số là 31,6 tỷ, trong đó có 3,6 tỷ tham số hoạt động. Theo nền tảng đánh giá độc lập Artificial Analysis, mô hình đạt chỉ số Trí tuệ (Intelligence Index) là 24, tăng 9 điểm so với phiên bản tiền nhiệm (15). Điều này đưa Lightning ngang hàng với gpt-oss-120b của OpenAI (24) và chỉ kém một chút so với Nemotron 3 Super (26) của chính Nvidia, mô hình có kích thước lớn gấp khoảng bốn lần. Các mô hình nhỏ thông minh nhất cùng phân khúc, như Qwen3.6 35B A3B (32) hay Muse Glimmer (35) mới của Meta, vẫn dẫn trước rõ ràng. Nvidia nhắm Lightning đến một điểm khác trên biên giới hiệu suất: trong các bài kiểm tra sơ bộ với trọng số NVFP4 cuối cùng, mô hình đạt gần 670 token mỗi giây, mức đo được cao nhất trong số các mô hình được so sánh và nhanh gần gấp đôi so với Gemini 3.5 Flash-Lite của Google (386 token/giây). Do đó, một nhiệm vụ từ chỉ số Trí tuệ mất khoảng 0,5 phút, trong khi Qwen3.6 35B A3B mất khoảng 3,5 phút và Gemma 4 31B khoảng 5,8 phút. Các mô hình độc quyền tiếp tục thống trị toàn bộ biên giới hiệu suất: Gemini 3.5 Flash-Lite đạt chỉ số Trí tuệ 37 với thời gian cho mỗi nhiệm vụ tương tự, GPT-5.6 Luna (max) đạt 52 điểm trong chưa đầy hai phút. Theo Artificial Analysis, những cải tiến lớn nhất nằm ở khả năng tác tử (agentic). Trong GDPval-AA v2, Lightning đạt điểm Elo 824, tăng 334 điểm so với Nemotron 3 Nano, vượt qua cả gpt-oss-120b (800) và Nemotron 3 Super (698) lớn hơn. Trong Terminal-Bench v2.1, điểm số tăng từ 7 lên 24,3 phần trăm, gần như ngang bằng với gpt-oss-120b (26,2 phần trăm). Với giấy phép OpenMDW-1.1 cho phép, Nvidia định vị mô hình này như một con ngựa thồ hiệu quả cho các quy trình tác tử thông lượng cao. Theo Artificial Analysis, Nvidia đã hợp tác với các đối tác như CodeRabbit và Harvey trong giai đoạn hậu huấn luyện để cải thiện hiệu suất trong các lĩnh vực cụ thể. Nvidia cung cấp mô hình dưới dạng trọng số BF16 và NVFP4; phiên bản NVFP4 cũng đạt 24 trên chỉ số Trí tuệ với mức suy giảm tối thiểu so với phiên bản có độ chính xác cao hơn. Mô hình suy luận chỉ xử lý văn bản và có cửa sổ ngữ cảnh một triệu token. Trọng số hiện có sẵn ngay lập tức; suy luận không có máy chủ được cung cấp bởi DeepInfra, Fireworks, FriendliAI, CoreWeave, GMI Cloud, Nebius và Crusoe.
Nguồn: The Decoder (DE) — bản gốc
Bài viết liên quan trước đây ↓
Tin mới