Mac Mini M4 Pro और OpenClaw: स्थानीय LLM इनफ़्रेन्स का परीक्षण
Apple
OpenAI
Google/DeepMind
यह लेख 48 GB RAM वाले Mac mini M4 Pro पर OpenClaw और LM Studio का उपयोग करके स्थानीय LLM इनफ़्रेन्स का परीक्षण करता है। तीन मॉडलों की तुलना की गई है: google/gemma-4-26b-a4b-qat, qwen/qwen3.6-35b-a3b, और google/gemma-4-31b। परिणाम बताते हैं कि MoE मॉडल जैसे gemma-4-26b और qwen3.6-35b, डेंस मॉडल gemma-4-31b की तुलना में बेहतर गति और ऊर्जा दक्षता प्रदान करते हैं।
लेखक ने 48 जीबी रैम वाले मैक मिनी एम4 प्रो पर स्थानीय एलएलएम इंफरेंस का परीक्षण किया, जिसमें एआई एजेंट के रूप में ओपनक्लॉ और मॉडल चलाने के लिए एलएम स्टूडियो का उपयोग किया गया। ओपनक्लॉ एप्लिकेशन और मैसेंजर्स को जोड़ने के लिए एक सेल्फ-होस्टेड गेटवे है जिसमें एआई एजेंटों को एकीकृत करने की क्षमता है। परीक्षण के लिए तीन मॉडल चुने गए: google/gemma-4-26b-a4b-qat (एमएलएक्स, 4-बिट), qwen/qwen3.6-35b-a3b (जीजीयूएफ, Q4_K_M), और google/gemma-4-31b (जीजीयूएफ, Q4_K_M)। पिंग टाइम क्रमशः 4, 3 और 12 सेकंड थे। जब सेलेक्टेल के बारे में समाचार पूछा गया, तो qwen3.6-35b-a3b मॉडल ने 60 सेकंड में सबसे विस्तृत प्रतिक्रिया दी, gemma-4-26b-a4b-qat ने 60 सेकंड में विश्लेषणात्मक प्रतिक्रिया दी, जबकि gemma-4-31b ने 300 सेकंड में संक्षिप्त प्रतिक्रिया प्रदान की। सिंथेटिक अनुबिस बेंचमार्क से पता चला कि gemma-4-26b-a4b-qat प्रति टोकन 59 टोकन उत्पन्न करता है जिसमें प्रति टोकन 0.38 जूल ऊर्जा खपत होती है, qwen3.6-35b-a3b प्रति सेकंड 50 टोकन और प्रति टोकन 0.45 जूल उत्पन्न करता है, जबकि gemma-4-31b केवल प्रति सेकंड 10 टोकन और प्रति टोकन 2.73 जूल का प्रबंधन करता है। जीपीयू उपयोग 99% तक पहुंच गया, जबकि सीपीयू उपयोग 10% से नीचे था। एमओई मॉडल (gemma-4-26b और qwen3.6-35b) डेंस gemma-4-31b मॉडल की तुलना में काफी तेज और अधिक ऊर्जा-कुशल हैं।
स्रोत: Habr — хаб ИИ —
मूल
