硬件与推理智能体 🇷🇺 24.07.2026 03:01

Mac Mini M4 Pro与OpenClaw:测试本地大语言模型推理

AppleApple OpenAIOpenAI Google/DeepMindGoogle/DeepMind
本文在配备48 GB RAM的Mac mini M4 Pro上,使用OpenClaw和LM Studio测试本地大语言模型推理。比较了三个模型:google/gemma-4-26b-a4b-qat、qwen/qwen3.6-35b-a3b和google/gemma-4-31b。结果显示,混合专家模型(如gemma-4-26b和qwen3.6-35b)在速度和能效方面优于密集模型gemma-4-31b。
作者在一台配备48GB内存的Mac mini M4 Pro上测试了本地大语言模型推理,使用OpenClaw作为AI代理,并用LM Studio运行模型。OpenClaw是一个自托管网关,用于连接应用和即时通讯工具,并能够集成AI代理。测试选取了三个模型:google/gemma-4-26b-a4b-qat(MLX格式,4位量化)、qwen/qwen3.6-35b-a3b(GGUF格式,Q4_K_M量化)以及google/gemma-4-31b(GGUF格式,Q4_K_M量化)。响应时间分别为4秒、3秒和12秒。当询问关于Selectel的消息时,qwen3.6-35b-a3b模型在60秒内给出了最详细的回答,gemma-4-26b-a4b-qat在60秒内提供了分析性回答,而gemma-4-31b则在300秒内给出了简短回答。合成Anubis基准测试显示,gemma-4-26b-a4b-qat每秒生成59个token,能耗为每个token 0.38焦耳;qwen3.6-35b-a3b每秒生成50个token,能耗为每个token 0.45焦耳;而gemma-4-31b每秒仅生成10个token,能耗为每个token 2.73焦耳。GPU利用率达到99%,而CPU使用率低于10%。专家混合模型(MoE)——即gemma-4-26b和qwen3.6-35b——在速度和能效上显著优于密集型的gemma-4-31b模型。
来源: Habr — хаб ИИ — 原文
我们之前关于此话题的帖子 ↓
最新新闻