ضبط نموذج ruGPT-3 XL 1.3B لمستوى LLM الحديث ومقارنته مع Gemma3 1B
Сбербанк
Google/DeepMind
قام أحد المتحمسين بضبط نموذج التدريب المسبق ruGPT-3 XL 1.3B (من عام 2020) باستخدام تقنيتي SFT وDPO ليصل إلى مستوى LLM الحديث. تمت مقارنة النموذج الناتج مع Gemma3 1B من عام 2025؛ وفي العديد من الاختبارات، أظهر ruGPT-3 XL إجابات أكثر دقة وإيجازًا، خاصة في مهام المنطق والمعرفة بالثقافة الروسية.
قام مؤلف المقال بإعادة تدريب نموذج pretrain قديم ruGPT-3 XL 1.3B، الذي صدر في الفترة 2020-2021، والذي كان في البداية قادرًا فقط على استمرار النص. باستخدام أسلوبي الضبط الدقيق المُشرِف (Supervised Fine-Tuning - SFT) وتحسين التفضيل المباشر (Direct Preference Optimization - DPO)، حوّله إلى نموذج لغوي كبير موجّه بالتعليمات. بالنسبة لـ SFT، تم استخدام مجموعة بيانات IlyaGusev/saiga_preferences (30 ألف سجل)، واستغرق التدريب حوالي 1.5 ساعة لكل حقبة باستخدام أداة SFTTrainer من Hugging Face. بعد إعادة التدريب، تعلّم النموذج فهم الأسئلة، وإعطاء إجابات صحيحة، والالتزام بقالب الحوار، وإنهاء التوليد برمز نهاية التسلسل (EOS). كما أجرى المؤلف مقارنة مع النموذج الحديث Gemma3 1B (2025)، الذي تم تدريبه على 2 تريليون رمز. في اختبارات معرفة فرق الروك الروسية، والحوارات متعددة الخطوات، والأسئلة المعقدة في الفيزياء، والألغاز، والإجابات المختصرة، أظهر ruGPT-3 XL نتائج أفضل أو متكافئة، على الرغم من أنه في بعض المهام، مثل محاكاة طرفية لينكس، كان أداء Gemma3 1B أفضل. كما يُلاحظ أن النموذج يمكنه استخدام سلسلة الاستدلال (Chain of Thought - CoT) لتحسين جودة الإجابات. بعد إعادة التدريب، تم تحويل النموذج إلى تنسيق GGUF لسهولة الاستخدام في أداة llama.cpp.
المصدر: Habr — хаб ML —
الأصلي
