Perangkat Keras & InferensiAgen 🇷🇺 24.07.2026 03:01

Mac Mini M4 Pro dan OpenClaw: Menguji Inferensi LLM Lokal

AppleApple OpenAIOpenAI Google/DeepMindGoogle/DeepMind
Artikel ini menguji inferensi LLM lokal pada Mac mini M4 Pro dengan RAM 48 GB menggunakan OpenClaw dan LM Studio. Tiga model dibandingkan: google/gemma-4-26b-a4b-qat, qwen/qwen3.6-35b-a3b, dan google/gemma-4-31b. Hasilnya menunjukkan bahwa model MoE seperti gemma-4-26b dan qwen3.6-35b menawarkan kecepatan dan efisiensi energi yang lebih baik dibandingkan model padat gemma-4-31b.
Penulis menguji inferensi LLM lokal pada Mac mini M4 Pro dengan RAM 48 GB, menggunakan OpenClaw sebagai agen AI dan LM Studio untuk menjalankan model. OpenClaw adalah gateway yang dihosting sendiri untuk menghubungkan aplikasi dan pengirim pesan dengan kemampuan mengintegrasikan agen AI. Tiga model dipilih untuk pengujian: google/gemma-4-26b-a4b-qat (MLX, 4-bit), qwen/qwen3.6-35b-a3b (GGUF, Q4_K_M), dan google/gemma-4-31b (GGUF, Q4_K_M). Waktu respons masing-masing adalah 4, 3, dan 12 detik. Ketika ditanya tentang berita terkait Selectel, model qwen3.6-35b-a3b memberikan respons paling rinci dalam 60 detik, gemma-4-26b-a4b-qat memberikan respons analitis dalam 60 detik, dan gemma-4-31b memberikan respons singkat dalam 300 detik. Tolok ukur sintetis Anubis menunjukkan bahwa gemma-4-26b-a4b-qat menghasilkan 59 token per detik dengan konsumsi energi 0,38 Joule per token, qwen3.6-35b-a3b menghasilkan 50 token per detik dan 0,45 Joule per token, sedangkan gemma-4-31b hanya mampu 10 token per detik dan 2,73 Joule per token. Penggunaan GPU mencapai 99%, sementara penggunaan CPU di bawah 10%. Model MoE (gemma-4-26b dan qwen3.6-35b) secara signifikan lebih cepat dan lebih hemat energi dibandingkan model padat gemma-4-31b.
Sumber: Habr — хаб ИИ — asli
Postingan kami sebelumnya tentang topik ini ↓
Berita terbaru