Phần cứng & Suy luậnTác tử 🇷🇺 24.07.2026 03:01

Mac Mini M4 Pro và OpenClaw: thử nghiệm suy luận LLM cục bộ

AppleApple OpenAIOpenAI Google/DeepMindGoogle/DeepMind
Bài viết thử nghiệm suy luận LLM cục bộ trên Mac mini M4 Pro với 48 GB RAM sử dụng OpenClaw và LM Studio. Ba mô hình được so sánh: google/gemma-4-26b-a4b-qat, qwen/qwen3.6-35b-a3b, và google/gemma-4-31b. Kết quả cho thấy các mô hình MoE như gemma-4-26b và qwen3.6-35b mang lại tốc độ và hiệu suất năng lượng tốt hơn so với mô hình dense gemma-4-31b.
Tác giả thử nghiệm suy luận LLM cục bộ trên Mac mini M4 Pro với 48 GB RAM, sử dụng OpenClaw làm tác nhân AI và LM Studio để chạy các mô hình. OpenClaw là một cổng tự lưu trữ (self-hosted) để kết nối các ứng dụng và trình nhắn tin với khả năng tích hợp tác nhân AI. Ba mô hình được chọn để thử nghiệm: google/gemma-4-26b-a4b-qat (MLX, 4-bit), qwen/qwen3.6-35b-a3b (GGUF, Q4_K_M) và google/gemma-4-31b (GGUF, Q4_K_M). Thời gian phản hồi lần lượt là 4, 3 và 12 giây. Khi được hỏi tin tức về Selectel, mô hình qwen3.6-35b-a3b đưa ra phản hồi chi tiết nhất trong 60 giây, gemma-4-26b-a4b-qat đưa ra phản hồi phân tích trong 60 giây, còn gemma-4-31b chỉ đưa ra phản hồi ngắn gọn trong 300 giây. Điểm chuẩn tổng hợp Anubis cho thấy gemma-4-26b-a4b-qat tạo ra 59 token mỗi giây với mức tiêu thụ năng lượng 0,38 Joules mỗi token, qwen3.6-35b-a3b tạo ra 50 token mỗi giây và 0,45 Joules mỗi token, trong khi gemma-4-31b chỉ đạt 10 token mỗi giây và 2,73 Joules mỗi token. Mức sử dụng GPU đạt 99%, trong khi CPU dưới 10%. Các mô hình MoE (gemma-4-26b và qwen3.6-35b) nhanh hơn đáng kể và tiết kiệm năng lượng hơn so với mô hình dense gemma-4-31b.
Nguồn: Habr — хаб ИИ — bản gốc
Bài viết liên quan trước đây ↓
Tin mới