الأبحاثالنماذج 🇷🇺 26.07.2026 21:04

ضبط ruGPT-3 XL 1.3B القديم ليصبح على مستوى نماذج اللغات الحديثة ومقارنته مع Gemma3 1B

СбербанкСбербанк Google/DeepMindGoogle/DeepMind
تم ضبط نموذج ruGPT-3 XL 1.3B القديم من عام 2020 باستخدام طريقتي SFT و DPO، وتحويله إلى نموذج لغوي حديث يتبع التعليمات. تمت مقارنة النتيجة مع نموذج Gemma3 1B من عام 2025، وأظهرت أن ruGPT المضبوط غالبًا ما يتفوق على Gemma3 في المنطق والإبداع، رغم أنه يواجه صعوبات في التعليمات السلبية ولعب الأدوار.
نموذج ruGPT-3 XL 1.3B، الذي كان في الأصل نموذجًا مُدرّبًا مسبقًا من عام 2020 قادرًا فقط على مواصلة النص، تم ضبطه بدقة باستخدام تقنيتي الضبط الخاضع للإشراف (Supervised Fine-Tuning - SFT) وتحسين التفضيل المباشر (Direct Preference Optimization - DPO) لإنتاج نموذج لغوي كبير حديث يتبع التعليمات. بعد تطبيق تقنية SFT على مجموعة بيانات تحتوي على 42 مليون رمز مستمدة من saiga_preferences، تعلم النموذج كيفية اتباع التعليمات والإجابة عن الأسئلة والحفاظ على حوارات متعددة الأدوار. ثم تمت مقارنته بنموذج Gemma3 1B، وهو نموذج صدر عام 2025 ودُرّب على 2 تريليون رمز. أدى نموذج ruGPT المُضبوط بدقة أفضل في مهام مثل المعرفة بفرق الروك الروسية، والمحادثات متعددة الخطوات، وأسئلة فيزياء الكم، ولغز مكاني. كما تعامل مع التعليمات السلبية (مثل تجنب كلمة محددة) بعد عدة محاولات لإعادة التوليد، بينما فشل نموذج Gemma3 في معظم المهام باستثناء تمثيل الأدوار ومحاكاة الطرفية، حيث واجه ruGPT صعوبة. أدى تطبيق تقنية DPO إلى تحسين التوافق بشكل أكبر، على الرغم من أن المقال يشير إلى أن مجموعة بيانات SPT الصغيرة حدت من قابلية التعميم.
المصدر: Habr — хаб ML — الأصلي
منشوراتنا السابقة حول هذا الموضوع ↓
أخبار جديدة