اختبار أداء Mac Mini M4 Pro وOpenClaw في استدلال نماذج اللغة المحلية
Apple
OpenAI
Google/DeepMind
تختبر المقالة استدلال نماذج اللغة المحلية على Mac mini M4 Pro بسعة 48 جيجابايت من ذاكرة الوصول العشوائي باستخدام OpenClaw وLM Studio. تمت مقارنة ثلاثة نماذج: google/gemma-4-26b-a4b-qat، و qwen/qwen3.6-35b-a3b، و google/gemma-4-31b. أظهرت النتائج أن نماذج MoE مثل gemma-4-26b و qwen3.6-35b توفر سرعة أفضل وكفاءة في استهلاك الطاقة مقارنة بالنموذج الكثيف gemma-4-31b.
اختبر المؤلف الاستدلال المحلي لنماذج اللغة الكبيرة على جهاز Mac mini M4 Pro بذاكرة وصول عشوائي سعتها 48 جيجابايت، باستخدام OpenClaw كعامل ذكاء اصطناعي وLM Studio لتشغيل النماذج. OpenClaw هي بوابة مستضافة ذاتيًا لتوصيل التطبيقات والمراسلات مع إمكانية دمج عوامل الذكاء الاصطناعي. تم اختيار ثلاثة نماذج للاختبار: google/gemma-4-26b-a4b-qat (MLX، 4-bit)، و qwen/qwen3.6-35b-a3b (GGUF، Q4_K_M)، و google/gemma-4-31b (GGUF، Q4_K_M). كانت أوقات الاستجابة 4 و 3 و 12 ثانية على التوالي. عند السؤال عن أخبار Selectel، أعطى نموذج qwen3.6-35b-a3b الرد الأكثر تفصيلاً في 60 ثانية، وقدم نموذج gemma-4-26b-a4b-qat ردًا تحليليًا في 60 ثانية، وقدم نموذج gemma-4-31b ردًا موجزًا في 300 ثانية. أظهرت معايير Synthetic Anubis أن نموذج gemma-4-26b-a4b-qat يولد 59 رمزًا في الثانية باستهلاك طاقة يبلغ 0.38 جول لكل رمز، بينما ينتج نموذج qwen3.6-35b-a3b 50 رمزًا في الثانية و 0.45 جول لكل رمز، بينما يدير نموذج gemma-4-31b 10 رموز فقط في الثانية و 2.73 جول لكل رمز. بلغ استخدام وحدة معالجة الرسوميات 99%، بينما كان استخدام المعالج المركزي أقل من 10%. نماذج MoE (gemma-4-26b و qwen3.6-35b) أسرع بشكل ملحوظ وأكثر كفاءة في الطاقة من النموذج الكثيف gemma-4-31b.
المصدر: Habr — хаб ИИ —
الأصلي
