Phần cứng & Suy luận 🇷🇺 03.08.2026 13:02

Mac mini M4 Tốc Độ Token Thực Tế: Kết Quả Đo Hiệu Năng

AppleApple MetaMeta MistralMistral Alibaba/QwenAlibaba/Qwen DeepSeekDeepSeek
Một chủ dịch vụ cho thuê Mac đã đo hiệu năng sáu mô hình ngôn ngữ lớn (LLM) trên Mac mini M4 (16GB) với phương pháp nhất quán, phát hiện rằng tốc độ sinh token bị giới hạn bởi bộ nhớ và tỷ lệ nghịch với kích thước mô hình. Llama 3.2 3B đạt 46,7 token/giây, trong khi Qwen 2.5 14B chỉ đạt 11,7 token/giây; xử lý prompt nhanh hơn 10-20 lần. Lời khuyên thực tế: mô hình 8B hoạt động tốt trên 16GB, mô hình lớn hơn cần nhiều bộ nhớ hơn.
Một chủ dịch vụ cho thuê máy Mac đã tiến hành các bài kiểm tra chuẩn có thể tái lập trên Mac mini M4 với 16GB bộ nhớ hợp nhất và băng thông 120 GB/s, sử dụng Ollama 0.31.2, macOS 15.3.1, lượng tử hóa Q4_K_M, một lời nhắc cố định và ba lần chạy cho mỗi mô hình (cộng với một lần khởi động bị loại bỏ). Kết quả: Llama 3.2 3B tạo ra 46,7 tok/s, Mistral 7B đạt 22,8, Qwen 2.5 7B đạt 22,3, Llama 3.1 8B đạt 21,2, DeepSeek R1 8B đạt 20,0 và Qwen 2.5 14B đạt 11,7. Tốc độ xử lý lời nhắc dao động từ 531 đến 1720 tok/s. Tác giả kết luận rằng quá trình tạo sinh bị giới hạn bởi bộ nhớ, do đó tốc độ gần bằng băng thông chia cho kích thước mô hình (ví dụ: dự đoán ~25 tok/s cho 8B Q4, đo được 21). Họ lưu ý rằng M4 Pro và M4 Max nên mở rộng theo băng thông, không phải theo số lõi. Họ khuyến nghị các mô hình 8B cho 16GB là thoải mái (trên 20 tok/s), trong khi 14B có vẻ chậm; ngữ cảnh dài thì xử lý rẻ nhưng tạo sinh lại đắt. Hạn chế: cấu hình đơn, lượng tử hóa đơn, chỉ tạo sinh văn bản; chưa kiểm tra xử lý theo lô. Dữ liệu được công bố mở theo giấy phép CC BY.
Nguồn: Habr — хаб ИИ — bản gốc
Bài viết liên quan trước đây ↓
Tin mới