الأبحاثمفتوح المصدر 🇺🇸 12.08.2026 21:03

AllenAI Open Instruct Tulu 3 ما بعد التدريب مع SFT و DPO و RLVR و GRPO وتقييم قائم على المدقق

AllenAIAllenAI
يوضح هذا البرنامج التعليمي خط أنابيب ما بعد التدريب من البداية إلى النهاية لنموذج لغوي باستخدام إطار عمل Open Instruct من AllenAI، مع تكييفه للعمل على وحدة معالجة رسومات بسعة 16 غيغابايت. ويغطي الضبط الدقيق الخاضع للإشراف (SFT)، وتحسين التفضيل المباشر (DPO)، والتعلم المعزز بالمكافآت القابلة للتحقق (RLVR) باستخدام GRPO، مع مدققات حتمية لتقييم الإجابات الرياضية.
يشرح هذا البرنامج التعليمي كيفية بناء نموذج لغوي مضغوط مضبوط بالتعليمات باستخدام إطار عمل Open Instruct من AllenAI. تتضمن خطوات التنفيذ ثلاث مراحل تدريب: الضبط الدقيق الخاضع للإشراف (SFT)، والتحسين المباشر للتفضيل (DPO)، والتعلم المعزز بالمكافآت القابلة للتحقق (RLVR) باستخدام GRPO، وكلها مُكيَّفة لتعمل على ذاكرة وصول عشوائي (RAM) سعتها 16 جيجابايت. يعتمد التنفيذ على مستودع Open Instruct، مع تحميل انتقائي لدوال مثل دالة خسارة DPO ودالة خسارة GRPO وحسابات الاحتمال اللوغاريتمي. يتم تكوين محولات LoRA، ويتم تحضير بيانات GSM8K لكل مرحلة. تُستخدم مُتحقِّقات حتمية (GSM8K وMath وIFEval) لقياس دقة الإجابات الرياضية المولَّدة. تُستبدل المكونات الموزعة مثل vLLM وRay actors وDeepSpeed بتنفيذات خفيفة الوزن تعتمد على Hugging Face وPyTorch تناسب بيئة Colab. النموذج المستخدم هو Qwen2.5-0.5B-Instruct.
المصدر: MarkTechPost — الأصلي
منشوراتنا السابقة حول هذا الموضوع ↓
أخبار جديدة