Mac mini M4 वास्तविक दुनिया टोकन प्रति सेकंड: बेंचमार्क परिणाम

AppleApple MetaMeta MistralMistral Alibaba/QwenAlibaba/Qwen DeepSeekDeepSeek
एक Mac रेंटल सेवा मालिक ने Mac mini M4 (16GB) पर छह LLM का एक समान पद्धति के साथ बेंचमार्क किया, और पाया कि जनरेशन गति मेमोरी-बद्ध है और मॉडल आकार के विपरीत अनुपात में बदलती है। Llama 3.2 3B ने 46.7 टोकन/सेकंड हासिल किया, जबकि Qwen 2.5 14B केवल 11.7 टोकन/सेकंड पर चला; प्रॉम्प्ट प्रोसेसिंग 10-20 गुना तेज़ थी। व्यावहारिक सलाह: 8B मॉडल 16GB पर आरामदायक हैं, बड़े मॉडलों को अधिक मेमोरी की आवश्यकता होती है।
एक मैक किराये की सेवा के मालिक ने 16GB यूनिफाइड मेमोरी और 120 GB/s बैंडविड्थ वाले Mac mini M4 पर Ollama 0.31.2, macOS 15.3.1, Q4_K_M क्वांटाइजेशन, एक निश्चित प्रॉम्प्ट और प्रति मॉडल तीन रन (एक त्याग दिया गया वार्म-अप सहित) का उपयोग करके प्रतिलिपि प्रस्तुत करने योग्य बेंचमार्क आयोजित किए। परिणाम: Llama 3.2 3B ने 46.7 tok/s उत्पन्न किया, Mistral 7B ने 22.8, Qwen 2.5 7B ने 22.3, Llama 3.1 8B ने 21.2, DeepSeek R1 8B ने 20.0, और Qwen 2.5 14B ने 11.7। प्रॉम्प्ट प्रोसेसिंग गति 531 से 1720 tok/s तक रही। लेखक ने निष्कर्ष निकाला कि जनरेशन मेमोरी-बाउंड है, इसलिए गति लगभग बैंडविड्थ को मॉडल आकार से विभाजित करने के बराबर है (उदाहरण के लिए, 8B Q4 के लिए ~25 tok/s की भविष्यवाणी, 21 मापा गया)। उन्होंने नोट किया कि M4 Pro और M4 Max को कोर के साथ नहीं, बल्कि बैंडविड्थ के साथ स्केल करना चाहिए। वे 16GB के लिए 8B मॉडल को आरामदायक (20+ tok/s) के रूप में सुझाते हैं, जबकि 14B धीमा लगता है; लंबे संदर्भ प्रोसेस करने में सस्ते हैं लेकिन जनरेट करने में महंगे हैं। सीमाएं: एकल कॉन्फ़िगरेशन, एकल क्वांटाइजेशन, केवल टेक्स्ट जनरेशन; कोई बैचिंग परीक्षण नहीं किया गया। डेटा CC BY के तहत खुला है।
स्रोत: Habr — хаб ИИ — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार