Mac Mini M4 Pro et OpenClaw : Test d'inférence LLM locale
Apple
OpenAI
Google/DeepMind
L'article teste l'inférence LLM locale sur un Mac mini M4 Pro avec 48 Go de RAM en utilisant OpenClaw et LM Studio. Trois modèles sont comparés : google/gemma-4-26b-a4b-qat, qwen/qwen3.6-35b-a3b et google/gemma-4-31b. Les résultats montrent que les modèles MoE comme gemma-4-26b et qwen3.6-35b offrent une meilleure vitesse et efficacité énergétique par rapport au modèle dense gemma-4-31b.
L'auteur teste l'inférence locale de LLM sur un Mac mini M4 Pro avec 48 Go de RAM, en utilisant OpenClaw comme agent IA et LM Studio pour exécuter les modèles. OpenClaw est une passerelle auto-hébergée pour connecter applications et messageries avec la capacité d'intégrer des agents IA. Trois modèles ont été sélectionnés pour les tests : google/gemma-4-26b-a4b-qat (MLX, 4 bits), qwen/qwen3.6-35b-a3b (GGUF, Q4_K_M) et google/gemma-4-31b (GGUF, Q4_K_M). Les temps de réponse (ping) étaient respectivement de 4, 3 et 12 secondes. Interrogé sur les actualités concernant Selectel, le modèle qwen3.6-35b-a3b a fourni la réponse la plus détaillée en 60 secondes, gemma-4-26b-a4b-qat a livré une réponse analytique en 60 secondes, et gemma-4-31b a donné une réponse brève en 300 secondes. Les benchmarks Synthetic Anubis ont montré que gemma-4-26b-a4b-qat génère 59 tokens par seconde avec une consommation d'énergie de 0,38 Joule par token, qwen3.6-35b-a3b produit 50 tokens par seconde et 0,45 Joule par token, tandis que gemma-4-31b n'atteint que 10 tokens par seconde et 2,73 Joules par token. L'utilisation du GPU atteignait 99 %, tandis que celle du CPU était inférieure à 10 %. Les modèles MoE (gemma-4-26b et qwen3.6-35b) sont nettement plus rapides et plus économes en énergie que le modèle dense gemma-4-31b.
Source: Habr — хаб ИИ —
original
