Mac Mini M4 ProとOpenClaw:ローカルLLM推論のテスト

AppleApple OpenAIOpenAI Google/DeepMindGoogle/DeepMind
この記事では、48 GB RAMを搭載したMac mini M4 ProでOpenClawとLM Studioを使用してローカルLLM推論をテストしています。google/gemma-4-26b-a4b-qat、qwen/qwen3.6-35b-a3b、google/gemma-4-31bの3つのモデルを比較。結果は、MoEモデルであるgemma-4-26bとqwen3.6-35bが、稠密モデルのgemma-4-31bよりも優れた速度とエネルギー効率を示しました。
著者は、48GBのRAMを搭載したMac mini M4 Pro上でローカルLLM推論をテストし、AIエージェントとしてOpenClaw、モデル実行にLM Studioを使用しています。OpenClawは、アプリケーションやメッセンジャーを接続してAIエージェントを統合できるセルフホスト型のゲートウェイです。テスト用に3つのモデルが選択されました:google/gemma-4-26b-a4b-qat(MLX、4ビット)、qwen/qwen3.6-35b-a3b(GGUF、Q4_K_M)、およびgoogle/gemma-4-31b(GGUF、Q4_K_M)。応答時間(ping time)はそれぞれ4秒、3秒、12秒でした。Selectelに関するニュースを尋ねたところ、qwen3.6-35b-a3bモデルが60秒で最も詳細な回答を提供し、gemma-4-26b-a4b-qatは60秒で分析的な回答を、gemma-4-31bは300秒で簡潔な回答を提供しました。合成Anubisベンチマークでは、gemma-4-26b-a4b-qatは1秒あたり59トークンを生成し、エネルギー消費はトークンあたり0.38ジュール、qwen3.6-35b-a3bは1秒あたり50トークンでトークンあたり0.45ジュール、一方gemma-4-31bは1秒あたりわずか10トークンでトークンあたり2.73ジュールでした。GPU使用率は99%に達し、CPU使用率は10%未満でした。MoEモデル(gemma-4-26bおよびqwen3.6-35b)は、高密度モデルのgemma-4-31bよりも大幅に高速でエネルギー効率が高いことが示されました。
出典: Habr — хаб ИИ — 原文
関連記事 ↓
新着ニュース