Mac Mini M4 Pro ve OpenClaw: Yerel LLM Çıkarımının Test Edilmesi
Apple
OpenAI
Google/DeepMind
Makale, 48 GB RAM'e sahip bir Mac mini M4 Pro üzerinde OpenClaw ve LM Studio kullanarak yerel büyük dil modeli (LLM) çıkarımını test ediyor. google/gemma-4-26b-a4b-qat, qwen/qwen3.6-35b-a3b ve google/gemma-4-31b olmak üzere üç model karşılaştırılıyor. Sonuçlar, gemma-4-26b ve qwen3.6-35b gibi uzman karışımı (MoE) modellerinin, yoğun model gemma-4-31b'ye kıyasla daha iyi hız ve enerji verimliliği sunduğunu gösteriyor.
Yazar, 48 GB RAM'e sahip bir Mac mini M4 Pro üzerinde yerel Büyük Dil Modeli (LLM) çıkarımını test ediyor; bunun için OpenClaw adlı yapay zeka aracısını ve modelleri çalıştırmak için LM Studio'yu kullanıyor. OpenClaw, uygulamaları ve mesajlaşma platformlarını birbirine bağlayan, yapay zeka aracıları entegre etme yeteneğine sahip, kendi kendine barındırılan bir ağ geçididir. Test için üç model seçildi: google/gemma-4-26b-a4b-qat (MLX, 4-bit), qwen/qwen3.6-35b-a3b (GGUF, Q4_K_M) ve google/gemma-4-31b (GGUF, Q4_K_M). Ping süreleri sırasıyla 4, 3 ve 12 saniyeydi. Selectel hakkında haber sorulduğunda, qwen3.6-35b-a3b modeli 60 saniyede en ayrıntılı yanıtı verdi, gemma-4-26b-a4b-qat 60 saniyede analitik bir yanıt sunarken, gemma-4-31b 300 saniyede kısa bir yanıt sağladı. Sentetik Anubis kıyaslamaları, gemma-4-26b-a4b-qat'ın saniyede 59 token ürettiğini ve token başına 0,38 Joule enerji tükettiğini, qwen3.6-35b-a3b'nin saniyede 50 token ve token başına 0,45 Joule, gemma-4-31b'nin ise sadece saniyede 10 token ve token başına 2,73 Joule ürettiğini gösterdi. GPU kullanımı %99'a ulaşırken, CPU kullanımı %10'un altında kaldı. MoE modelleri (gemma-4-26b ve qwen3.6-35b), yoğun gemma-4-31b modelinden belirgin şekilde daha hızlı ve enerji açısından daha verimlidir.
Kaynak: Habr — хаб ИИ —
orijinal
