Mac Mini M4 Pro e OpenClaw: Testando Inferência Local de LLM
Apple
OpenAI
Google/DeepMind
O artigo testa inferência local de LLM em um Mac mini M4 Pro com 48 GB de RAM usando OpenClaw e LM Studio. Três modelos são comparados: google/gemma-4-26b-a4b-qat, qwen/qwen3.6-35b-a3b e google/gemma-4-31b. Os resultados mostram que modelos MoE como gemma-4-26b e qwen3.6-35b oferecem melhor velocidade e eficiência energética em comparação com o modelo denso gemma-4-31b.
O autor testa a inferência local de LLMs no Mac mini M4 Pro com 48 GB de RAM, usando o OpenClaw como agente de IA e o LM Studio para executar os modelos. O OpenClaw é um gateway auto-hospedado para conectar aplicações e mensageiros com a capacidade de integrar agentes de IA. Três modelos foram selecionados para os testes: google/gemma-4-26b-a4b-qat (MLX, 4 bits), qwen/qwen3.6-35b-a3b (GGUF, Q4_K_M) e google/gemma-4-31b (GGUF, Q4_K_M). Os tempos de ping foram de 4, 3 e 12 segundos, respectivamente. Quando perguntados sobre notícias da Selectel, o modelo qwen3.6-35b-a3b deu a resposta mais detalhada em 60 segundos, o gemma-4-26b-a4b-qat entregou uma resposta analítica em 60 segundos, e o gemma-4-31b forneceu uma resposta breve em 300 segundos. Os benchmarks sintéticos Anubis mostraram que o gemma-4-26b-a4b-qat gera 59 tokens por segundo com um consumo de energia de 0,38 Joules por token, o qwen3.6-35b-a3b produz 50 tokens por segundo e 0,45 Joules por token, enquanto o gemma-4-31b consegue apenas 10 tokens por segundo e 2,73 Joules por token. O uso da GPU chegou a 99%, enquanto o uso da CPU ficou abaixo de 10%. Os modelos MoE (gemma-4-26b e qwen3.6-35b) são significativamente mais rápidos e energeticamente mais eficientes do que o modelo denso gemma-4-31b.
Fonte: Habr — хаб ИИ —
original
