Mini-PC Strix Halo chạy tải song song: 236 tok/s trên 32 yêu cầu đồng thời và ba lỗi
Google/DeepMind
Một Beelink GTR9 Pro với Ryzen AI Max+ 395 đạt 236 tok/s tổng hợp trên 32 yêu cầu đồng thời trong các lần chạy ngắn, duy trì trung bình 226 tok/s trong 30 phút mà không bị giảm hiệu năng. Tác giả phát hiện ra sự sụt giảm thông lượng có thể tái lập giữa 8 và 10 máy khách đồng thời trên tất cả các mô hình đã thử nghiệm, và thấy rằng giải mã suy luận (MTP - Multitoken Prediction) tăng tốc hiệu năng đơn máy khách lên 42% nhưng lại trở thành bất lợi dưới tải đồng thời.
Tác giả đã thử nghiệm Beelink GTR9 Pro (Ryzen AI Max+ 395, Radeon 8060S, 128 GB bộ nhớ hợp nhất) với llama.cpp thông qua Vulkan/RADV và chạy các điểm chuẩn suy luận song song. Qwen 3.6 35B-A3B ở dạng Q4_K_M cho thấy một vùng trũng thông lượng từ 149 tok/s với 8 client xuống còn 99 tok/s với 10 client, sau đó phục hồi lên 160 tok/s với 32 client. Vùng trũng này có thể tái tạo trên tất cả các mô hình được thử nghiệm (Qwen ở ba mức lượng tử hóa và Gemma 4 26B ở dạng QAT) và không thể quy cho một mô hình hoặc mức lượng tử hóa cụ thể nào. Tổng tốt nhất đạt 236 tok/s với Gemma 4 ở 32 client (trung vị của các lần chạy kéo dài 75 giây). Một bài kiểm tra độ bền kéo dài 30 phút đạt trung bình 226,4 tok/s với nhiệt độ ổn định (78°C) và công suất (113 W), với 1,4% lỗi do thiếu thời gian phản hồi từ máy chủ. Giải mã suy luận (MTP) đã tăng tốc độ client đơn lên 42% (53,3→75,6 tok/s) nhưng làm giảm khả năng đồng thời: với 4 client, nó giảm 31%, với 32 client, thông lượng mất 33%. Tác giả lưu ý ba lỗi đã được phát hiện trước khi công bố nhờ các phép đo đối chứng.
Nguồn: Habr — хаб NLP —
bản gốc
