Mac Mini M4 Pro y OpenClaw: Probando Inferencia Local de LLM
Apple
OpenAI
Google/DeepMind
El artículo prueba la inferencia local de LLM en un Mac mini M4 Pro con 48 GB de RAM usando OpenClaw y LM Studio. Se comparan tres modelos: google/gemma-4-26b-a4b-qat, qwen/qwen3.6-35b-a3b y google/gemma-4-31b. Los resultados muestran que los modelos MoE como gemma-4-26b y qwen3.6-35b ofrecen mejor velocidad y eficiencia energética en comparación con el modelo denso gemma-4-31b.
El autor prueba la inferencia local de LLM en una Mac mini M4 Pro con 48 GB de RAM, utilizando OpenClaw como agente de IA y LM Studio para ejecutar los modelos. OpenClaw es una puerta de enlace autoalojada para conectar aplicaciones y mensajeros con la capacidad de integrar agentes de IA. Se seleccionaron tres modelos para las pruebas: google/gemma-4-26b-a4b-qat (MLX, 4 bits), qwen/qwen3.6-35b-a3b (GGUF, Q4_K_M) y google/gemma-4-31b (GGUF, Q4_K_M). Los tiempos de respuesta fueron de 4, 3 y 12 segundos, respectivamente. Al preguntar por noticias sobre Selectel, el modelo qwen3.6-35b-a3b ofreció la respuesta más detallada en 60 segundos, gemma-4-26b-a4b-qat entregó una respuesta analítica en 60 segundos, y gemma-4-31b proporcionó una respuesta breve en 300 segundos. Los benchmarks sintéticos de Anubis mostraron que gemma-4-26b-a4b-qat genera 59 tokens por segundo con un consumo energético de 0,38 julios por token, qwen3.6-35b-a3b produce 50 tokens por segundo y 0,45 julios por token, mientras que gemma-4-31b solo alcanza 10 tokens por segundo y 2,73 julios por token. El uso de la GPU alcanzó el 99%, mientras que el uso de la CPU fue inferior al 10%. Los modelos MoE (gemma-4-26b y qwen3.6-35b) son significativamente más rápidos y eficientes energéticamente que el modelo denso gemma-4-31b.
Fuente: Habr — хаб ИИ —
original
