ハードウェア・推論 🇷🇺 03.08.2026 13:02

Mac mini M4実世界トークン/秒:ベンチマーク結果

AppleApple MetaMeta MistralMistral Alibaba/QwenAlibaba/Qwen DeepSeekDeepSeek
Macレンタルサービス運営者が、Mac mini M4(16GB)上で6つのLLMを一貫した方法論でベンチマークし、生成速度はメモリ帯域に依存し、モデルサイズに反比例することを発見しました。Llama 3.2 3Bは46.7トークン/秒に達した一方、Qwen 2.5 14Bはわずか11.7トークン/秒に留まりました。プロンプト処理は10〜20倍高速でした。実用的なアドバイス:8Bモデルは16GBで快適に動作し、より大きなモデルはより多くのメモリを必要とします。
Macレンタルサービスのオーナーが、Ollama 0.31.2、macOS 15.3.1、Q4_K_M量子化、固定プロンプト、モデルあたり3回の実行(ウォームアップ1回を除外)を用いて、16GBユニファイドメモリと120GB/s帯域幅を搭載したMac mini M4で再現可能なベンチマークを実施しました。結果は、Llama 3.2 3Bが46.7トークン/秒、Mistral 7Bが22.8、Qwen 2.5 7Bが22.3、Llama 3.1 8Bが21.2、DeepSeek R1 8Bが20.0、Qwen 2.5 14Bが11.7でした。プロンプト処理速度は531〜1720トークン/秒でした。著者は、生成はメモリ帯域幅に依存し、速度はほぼ帯域幅÷モデルサイズに等しい(例:8B Q4では約25トークン/秒と予測、実測21)と結論付けています。また、M4 ProとM4 Maxはコア数ではなく帯域幅に比例してスケールするはずだと指摘しています。16GBでは8Bモデルが快適(20+トークン/秒)で、14Bは遅く感じると勧めています。長いコンテキストは処理が安価ですが、生成にはコストがかかります。制限事項:単一構成、単一量子化、テキスト生成のみで、バッチ処理はテストされていません。データはCC BYライセンスで公開されています。
出典: Habr — хаб ИИ — 原文
関連記事 ↓
新着ニュース