Bonsai-27B على فرع llama.cpp التكراري: الإعداد الكامل وقياس الأداء الحقيقي على RTX 3050

cubetitled-uicubetitled-ui
يغطي هذا المقال الثالث حول فرع llama.cpp التكراري تشغيل نموذج Bonsai-27B الهجين (بنية Delta-Net الخطية) على بطاقة رسوميات ضعيفة، مع تقديم قياس أداء حقيقي لعُمق D=0 مقابل D=12 في مهمة حسابية رقمية. مع تفعيل التكرار (D=12)، نجح النموذج في حل SEND+MORE=MONEY، بينما فشل المحرك الأساسي. تُقدَّم أوامر الإعداد ومتغيرات البيئة الخاصة بالتكرار.
يقدم المؤلف الجزء الثالث من سلسلته حول فرع عودي (recursive) من مشروع llama.cpp، مع التركيز على نموذج Bonsai-27B، وهو نموذج هجين يضم طبقات Delta-Net الخطية وطبقات انتباه كامل. يتم تطبيق التكرار (recurrence) فقط على طبقات الانتباه الكامل. النموذج بكمية Q1_0 يبلغ حجمه حوالي 3.5 جيجابايت، مما يسمح بتشغيله ضمن ذاكرة فيديو سعتها 6 جيجابايت. تقدم المقالة تعليمات البناء لكل من CUDA ووحدة المعالجة المركزية، بالإضافة إلى أوامر الاستخدام مع متغيرات البيئة RECURRENT_D (العمق: 0، 12، 24)، وRECURRENT_LAYERS_COUNT، وRECURRENT_KV. تم إجراء اختبار أداء حقيقي على بطاقة RTX 3050 Mobile بسعة 6 جيجابايت مع بذرة عشوائية (seed) قيمتها 42 ودرجة حرارة (temperature) قيمتها 0.3 على لغز حسابي (cryptarithmetic) وهو SEND+MORE=MONEY، مع حد أقصى يبلغ 7000 رمز. عند D=0 تم توليد 7000 رمز دون حل اللغز، والوصول إلى حد الطول (finish_reason: length). وعند D=12 تم توليد 6594 رمزًا وتم حل اللغز بشكل صحيح بالقيم S=9, E=5, N=6, D=7, M=1, O=0, R=8, Y=2، مع التحقق من أن 9567+1085=10652، والتوقف بشكل صحيح (finish_reason: stop). كان زمن التوليد حوالي 5.5 دقيقة لكلتا الحالتين، مع سرعات بلغت 21.1 رمزًا في الثانية (عند D=0) و19.8 رمزًا في الثانية (عند D=12)، أي تباطؤ بنسبة 6% تقريبًا. تشير المقالة إلى أن التكرار لا يغير الأوزان، بل فقط الرسم البياني للحساب أثناء الاستدلال، وتدرج النماذج المتوافقة بما فيها Qwen3.5 وQwen2 وGemma 2 وMistral 3 وDelta-Net (Bonsai).
المصدر: Habr — хаб ИИ — الأصلي
منشوراتنا السابقة حول هذا الموضوع ↓
أخبار جديدة