Mac Mini M4 Pro en OpenClaw: Lokaal LLM Inference Testen
Apple
OpenAI
Google/DeepMind
Het artikel test lokaal LLM-inference op een Mac mini M4 Pro met 48 GB RAM met behulp van OpenClaw en LM Studio. Drie modellen worden vergeleken: google/gemma-4-26b-a4b-qat, qwen/qwen3.6-35b-a3b en google/gemma-4-31b. De resultaten tonen aan dat MoE-modellen zoals gemma-4-26b en qwen3.6-35b betere snelheid en energie-efficiëntie bieden vergeleken met het dense model gemma-4-31b.
De auteur test lokale LLM-inferentie op een Mac mini M4 Pro met 48 GB RAM, met behulp van OpenClaw als AI-agent en LM Studio voor het draaien van modellen. OpenClaw is een zelfgehoste gateway voor het verbinden van applicaties en berichtendiensten met de mogelijkheid om AI-agenten te integreren. Er werden drie modellen geselecteerd voor de test: google/gemma-4-26b-a4b-qat (MLX, 4-bit), qwen/qwen3.6-35b-a3b (GGUF, Q4_K_M) en google/gemma-4-31b (GGUF, Q4_K_M). De pingtijden waren respectievelijk 4, 3 en 12 seconden. Bij een vraag naar nieuws over Selectel gaf het qwen3.6-35b-a3b-model het meest gedetailleerde antwoord in 60 seconden, gemma-4-26b-a4b-qat leverde een analytisch antwoord in 60 seconden, en gemma-4-31b gaf een kort antwoord in 300 seconden. Synthetische Anubis-benchmarks toonden aan dat gemma-4-26b-a4b-qat 59 tokens per seconde genereert met een energieverbruik van 0,38 joule per token, qwen3.6-35b-a3b produceert 50 tokens per seconde en 0,45 joule per token, terwijl gemma-4-31b slechts 10 tokens per seconde haalt met 2,73 joule per token. Het GPU-gebruik bereikte 99%, terwijl het CPU-gebruik onder de 10% bleef. De MoE-modellen (gemma-4-26b en qwen3.6-35b) zijn aanzienlijk sneller en energiezuiniger dan het dichte gemma-4-31b-model.
Bron: Habr — хаб ИИ —
origineel
