ماك ميني M4: نتائج قياس أداء الرموز في الثانية في الاستخدام الفعلي
Apple
Meta
Mistral
Alibaba/Qwen
DeepSeek
قام مالك خدمة تأجير ماك بقياس أداء ستة نماذج لغوية كبيرة على جهاز ماك ميني M4 بذاكرة 16 جيجابايت باستخدام منهجية موحدة، ووجد أن سرعة التوليد تعتمد على الذاكرة وتتناسب عكسيًا مع حجم النموذج. بلغت سرعة نموذج Llama 3.2 3B حوالي 46.7 رمزًا في الثانية، بينما حقق نموذج Qwen 2.5 14B سرعة 11.7 رمزًا في الثانية فقط؛ وكانت معالجة الاستعلامات أسرع بـ10 إلى 20 مرة. توصيات عملية: نماذج 8B مريحة على ذاكرة 16 جيجابايت، بينما تحتاج النماذج الأكبر إلى ذاكرة أكبر.
قام مالك خدمة تأجير أجهزة Mac بإجراء اختبارات قياس أداء قابلة للتكرار على جهاز Mac mini M4 بذاكرة موحدة سعة 16 جيجابايت وعرض نطاق ترددي يبلغ 120 جيجابايت/ثانية، باستخدام Ollama 0.31.2، وmacOS 15.3.1، وقياس كمي Q4_K_M، ومطالبة ثابتة، وثلاث عمليات تشغيل لكل نموذج (بالإضافة إلى عملية إحماء مهملة). النتائج: Llama 3.2 3B أنتج 46.7 رمزًا في الثانية، وMistral 7B 22.8، وQwen 2.5 7B 22.3، وLlama 3.1 8B 21.2، وDeepSeek R1 8B 20.0، وQwen 2.5 14B 11.7. تراوحت سرعات معالجة المطالبة من 531 إلى 1720 رمزًا في الثانية. يستنتج المؤلف أن التوليد مقيد بالذاكرة، لذا فإن السرعة تساوي تقريبًا عرض النطاق الترددي مقسومًا على حجم النموذج (على سبيل المثال، ~25 رمزًا في الثانية متوقعًا لـ 8B Q4، و21 تم قياسها). ويشير إلى أن M4 Pro وM4 Max يجب أن يتدرجا مع عرض النطاق الترددي، وليس مع النوى. ويوصي بنماذج 8B لذاكرة 16 جيجابايت كخيار مريح (أكثر من 20 رمزًا في الثانية)، بينما يبدو 14B بطيئًا؛ والسياقات الأطول رخيصة في المعالجة ولكنها مكلفة في التوليد. القيود: تكوين واحد، وقياس كمي واحد، وتوليد نص فقط؛ ولم يتم اختبار المعالجة الدفعية. البيانات مفتوحة بموجب ترخيص المشاع الإبداعي (CC BY).
المصدر: Habr — хаб ИИ —
الأصلي
