硬件与推理 🇷🇺 03.08.2026 13:02

Mac mini M4 真实每秒令牌数:基准测试结果

AppleApple MetaMeta MistralMistral Alibaba/QwenAlibaba/Qwen DeepSeekDeepSeek
一位Mac租赁服务商老板在Mac mini M4(16GB)上使用统一方法论对六款大型语言模型进行了基准测试,发现生成速度受内存带宽限制,并随模型规模增大而反向变化。Llama 3.2 3B达到每秒46.7个令牌,而Qwen 2.5 14B仅每秒11.7个令牌;提示词处理速度则快10到20倍。实用建议:8B模型在16GB内存上运行流畅,更大模型则需要更多内存。
一位Mac租赁服务商在配备16GB统一内存和120 GB/s带宽的Mac mini M4上,使用Ollama 0.31.2、macOS 15.3.1、Q4_K_M量化、固定提示词,对每个模型运行三次(外加一次弃用的预热),进行了可复现的基准测试。结果:Llama 3.2 3B生成速度为46.7 tok/s,Mistral 7B为22.8,Qwen 2.5 7B为22.3,Llama 3.1 8B为21.2,DeepSeek R1 8B为20.0,Qwen 2.5 14B为11.7。提示处理速度介于531到1720 tok/s之间。作者得出结论,生成过程受内存带宽限制,因此速度大致等于带宽除以模型大小(例如,8B Q4模型预测约25 tok/s,实测21)。他们指出M4 Pro和M4 Max的性能应随带宽提升,而非核心数。他们推荐16GB内存的用户使用8B模型,能获得流畅体验(20+ tok/s),而14B模型则感觉较慢;长上下文处理成本低,但生成成本高。局限性:仅测试了单一配置、单一量化、纯文本生成;未测试批处理。数据以CC BY许可开放。
来源: Habr — хаб ИИ — 原文
我们之前关于此话题的帖子 ↓
最新新闻