كيف قلّصت مُضمّنًا روسيًا إلى 24 مليون معامل — وكادت خانة واحدة أن تُفسده
DeepPavlov
BAAI
Microsoft
درّب مهندس مُضمّنًا روسيًا خفيفًا يُدعى STRIZH، بعدد معاملات يبلغ 24.4 مليون و4 طبقات، لاستخدامه في الاسترجاع التوليدي المعزز المحلي على وحدة معالجة رسوميات مشتركة. رقم خاطئ واحد في إعداد المُرمِّز (model_max_length=256) أدى إلى انخفاض Recall@10 من 0.589 إلى 0.448، وكاد أن يُبطل العمل بأكمله. صُمم النموذج ليكون مرحلة استرجاع أولى سريعة على AMD Strix Halo، منافسًا bge-m3 في سيناريوهات المشاركة في الموارد.
طور المؤلف نموذج استرجاع كثيف روسي صغير يسمى STRIZH لنظام RAG محلي يعمل على عقدة AMD Strix Halo بذاكرة موحدة سعة 128 جيجابايت. تتشارك وحدة معالجة الرسومات المدمجة في العقدة بين نموذج التوليد اللغوي الضخم، والمضمن، وإعادة الترتيب، وإعادة الفهرسة الدورية، لذا هناك حاجة إلى مسترجع خفيف الوزن لتقليل التنافس على الحوسبة. بعد محاولة فاشلة لانحدار التضمين باستخدام دالة خسارة متوسط الخطأ التربيعي، نجح المؤلف في تدريب نموذج مانح للاسترجاع باثنتي عشرة طبقة باستخدام التعلم التبايني ثم قام بتقطيره إلى أربع طبقات. يحتوي STRIZH على 24.4 مليون معلمة، وحجم متجه 384، وتجميع متوسط، ولا توجد بادئات للاستعلام أو المقطع، ويدعم سياقًا يصل إلى 8192 رمزًا. على مجموعة بيانات محلية، حقق Recall@10 بقيمة 0.751 على مجموعة فرعية مُرشحة و0.800 على المجموعة الكاملة. في اختبارات الإقامة المشتركة مع Qwen3.6-35B-A3B، تسبب STRIZH في انخفاض إنتاجية التوليد بنسبة 2% فقط مقابل 7% لنموذج bge-m3 تحت حمل عبر الإنترنت يبلغ 200 استعلام في الثانية، وفهرسة 46 دفعة في الثانية مقابل 4.9 دفعة. ومع ذلك، تم اكتشاف خطأ بعد النشر: كان الإعداد model_max_length في إعدادات الرموز هو 256، وعند تطبيقه أدى إلى انخفاض Recall@10 من 0.589 إلى 0.448. يشير المؤلف إلى أن STRIZH ليس مصممًا لاستبدال النماذج الأكبر مثل USER2-small أو bge-m3، بل لملء مكانة متخصصة للاسترجاع الكثيف الفعال في ظل قيود الحوسبة الصارمة.
المصدر: Habr — хаб ИИ —
الأصلي
