تشغيل نماذج اللغات الكبيرة محلياً على آيفون: الذاكرة، Core ML، MLX، والقيود
Apple
Meta
تستعرض المقالة كيفية تشغيل نماذج اللغات الكبيرة محلياً على آيفون، متناولةً بنية Apple Silicon، والذاكرة الموحدة، والتكميم، وذاكرة التخزين المؤقت للمفاتيح والقيم (KV cache)، وCore ML مقابل MLX، والخنق الحراري، وخط أنابيب هجين. وتخلص إلى أن النماذج المحلية مبررة فقط في السيناريوهات الحساسة للخصوصية أو دون الاتصال بالإنترنت، بينما تكون النماذج السحابية متفوقة في غير ذلك.
المؤلف، وهو مطور iOS، يشرح التحديات التي تواجه تشغيل نماذج اللغة المحلية على آيفون. تستخدم Apple Silicon ذاكرة موحدة مشتركة بين وحدة المعالجة المركزية ووحدة معالجة الرسومات والمحرك العصبي، مع ذاكرة محدودة متاحة للتطبيقات. يعمل التكميم على تقليل حجم النموذج (مثلًا من FP16 إلى INT4) ولكنه قد يقلل من الدقة. ينمو مخبأ KV مع طول المحادثة وقد يؤدي إلى تشغيل Jetsam (قاتل ذاكرة النظام). تقدم Core ML تحسينًا ثابتًا وتحويلًا برمجيًا في وقت الترجمة، مع دعم للمحرك العصبي ولكن مع قيود على طول السياق. يستخدم MLX تقييمًا كسولًا ورسومًا بيانية ديناميكية، مما يقدم أداءً أفضل في الحلقات الانحدارية الذاتية ولكنه يسبب حرارة أكبر وكبحًا حراريًا. يقلل الكبح الحراري من أداء وحدة معالجة الرسومات للحفاظ على درجة حرارة الجهاز أقل من 43-45 درجة مئوية لراحة المستخدم. يوصي المؤلف بمراقبة الحالة الحرارية ويقترح خط أنابيب هجين للتوليد المستقر.
المصدر: Habr — хаб ИИ —
الأصلي
