Phần cứng & Suy luận 🇷🇺 03.08.2026 18:02

DeepSeek 0731 trên DGX Spark: Ép xung lên 68 tok/s và lý do tác giả card ghi 57

DeepSeekDeepSeek NVIDIANVIDIA vLLMvLLM
Một nhà phát triển đã đo điểm chuẩn DeepSeek-V4-Flash trên hệ thống hai NVIDIA DGX Spark, ban đầu đo được 42,5 tok/s so với mức 57 tok/s được ghi trên thẻ mô hình. Sau khi chuyển sang hình ảnh runtime vLLM và kích hoạt rõ ràng backend MoE B12X, họ đạt được 67,6 tok/s ở cấu hình giống như trên thẻ, và cho rằng những cải thiện này nhờ vào các thay đổi cấu hình cụ thể.
Tác giả đã triển khai DeepSeek-V4-Flash trên hai nút DGX Spark kết nối qua QSFP 200G với RoCEv2, sử dụng tensor parallelism giữa các nút. Các phép đo ban đầu cho thấy 42,5 tok/s, thấp hơn khoảng 25% so với con số 57 tok/s được công bố trên model card. Sau khi thử nghiệm một số giả thuyết (nhiệt độ, hạch toán prefill, độ dài ngữ cảnh), sự khác biệt chính được cho là do runtime image: chuyển từ bản dựng dựa trên vLLM 0.21.1 sang bản có vLLM 0.25.2 đã tăng 22% trên cùng checkpoint, tăng số token đầu ra trên mỗi bước xác minh từ 3,27 lên 4,80. Cải thiện thêm đến từ việc đặt rõ ràng cờ --moe-backend flashinfer_b12x, vì trong custom image, B12X bị loại khỏi quá trình tự động chọn lựa; điều này tăng thêm trung bình 13,3% trên hồ sơ giống card (từ 59,7 lên 67,6 tok/s). Tác giả cũng ghi nhận bản phát hành checkpoint mới (0731) với các benchmark agent được cải thiện, đồng thời thừa nhận công trình song song của tonyd2wild về các tối ưu hóa tương tự.
Nguồn: Habr — хаб ИИ — bản gốc
Bài viết liên quan trước đây ↓
Tin mới