استنتاج نموذج لغوي كبير على مجموعة من أجهزة الحاسوب المحمولة القديمة
Meta
Alibaba/Qwen
OpenAI
اختبرت تجربة الاستنتاج الموزع لنماذج اللغة الكبيرة عبر ثلاثة أجهزة حاسوب محمولة قديمة باستخدام بروتوكول RPC الخاص بـ llama.cpp. أظهرت النتائج أن الاستنتاج الموزع يوفر تسارعًا كبيرًا فقط عندما لا يتسع النموذج في ذاكرة عقدة واحدة؛ أما بالنسبة للنماذج الأصغر حجمًا، فإن الحمل الزائد للشبكة يجعل العقدة الواحدة السريعة أسرع. كما كشفت الاختبارات أن معالجة الاستعلامات تستفيد من التوازي، بينما لا يستفيد توليد الرموز من ذلك.
أُجريت تجربة لاختبار الاستدلال الموزع لنماذج اللغة الكبيرة على مجموعة من ثلاثة أجهزة كمبيوتر محمولة قديمة بمعالجات إنتل من أجيال مختلفة: Core i7-4700MQ (Haswell، 2013)، وCore i5-8265U (Whiskey Lake، 2018)، وCore i3-1115G4 (Tiger Lake، 2020)، بإجمالي ذاكرة وصول عشوائي (RAM) يبلغ 52 جيجابايت. البرنامج المستخدم كان llama.cpp (الإصدار b10069) مع خادم استدعاء إجراء عن بعد (RPC) على كل عقدة، وتم ربط العقد عبر إيثرنت بسرعة جيجابت. النماذج التي تم اختبارها هي Llama-3.2-1B-Instruct وLlama-3.1-8B-Instruct وQwen2.5-32B-Instruct (جميعها بصيغة Q4_K_M) وgpt-oss-20b (نموذج خليط الخبراء MoE). بالنسبة لنموذج 1B، أعطت المجموعة (i3+i5) سرعة توليد تبلغ 22.5 رمزًا في الثانية مقارنة بـ 29.2 رمزًا في الثانية على أفضل عقدة منفردة (i3)، أي تباطؤ بنسبة 23%. بالنسبة لنموذج 8B، كانت المجموعة قريبة من التكافؤ مع العقدة المنفردة (4.6 مقابل 4.9 رمزًا في الثانية)، لكن معالجة المطالبات كانت أسرع بثلاث مرات تقريبًا (10.9 مقابل 3.9 رمزًا في الثانية). بالنسبة لنموذج 32B، الذي لم يكن مناسبًا لأي عقدة منفردة، حققت المجموعة 1.1 رمزًا في الثانية مقابل 0.3 رمزًا في الثانية على عقدة مع استخدام الذاكرة الافتراضية (swap)، أي تحسن بنسبة 268%. مع نموذج خليط الخبراء gpt-oss-20b، الذي لم يكن مناسبًا أيضًا لعقدة واحدة، أعطت المجموعة توليدًا مستقرًا بمعدل 8.0-8.1 رمزًا في الثانية وتقييمًا للمطالبات بسرعة 15.4-15.9 رمزًا في الثانية، مقارنة بالأداء المنفرد غير المستقر. الاستنتاج هو أن الاستدلال الموزع له ما يبرره فقط عندما لا يتسع النموذج لعقدة واحدة؛ وإلا فإن العقدة السريعة الواحدة أفضل. أيضًا، تستفيد معالجة المطالبات من التوازي، بينما لا يستفيد توليد الرموز، وأي عقدة ضعيفة يمكن أن تصبح عنق زجاجة للمجموعة.
المصدر: Habr — хаб ML —
الأصلي
