الأبحاثالعوامل 🇺🇸 14.08.2026 20:03

دوال المكافأة المخصصة لتعلم التعزيز متعدد الأدوار مع Amazon Nova Forge

Amazon/AWSAmazon/AWS
يتيح Amazon Nova Forge دوال مكافأة مخصصة لتعلم التعزيز متعدد الأدوار، مما يسمح للفرق بتحديد شكل النتيجة الجيدة بينما تقوم الخدمة بتنسيق عمليات الإطلاق وحالة المحادثة. يغطي المنشور تصميم مكافآت متعددة الأدوار المركبة لـ GRPO، وتنفيذ التعليمات البرمجية المولدة من النموذج بأمان، والمزالق التي يمكن أن تنهار إشارة المكافأة.
في التعلم المعزز متعدد الخطوات (multi-turn RL)، تحدد دالة المكافأة المخصصة ما يتعلمه النموذج، وقد تؤدي مكافأة خاطئة بشكل دقيق إلى تعليم أمر خاطئ على الرغم من منحنيات التدريب الصحية. تقوم Amazon Nova Forge بتشغيل منطق المكافأة في بيئتك الخاصة من خلال Bring Your Own Orchestration (BYOO)، مع خيار التعلم المعزز متعدد الخطوات بدون خادم (serverless multi-turn RL) المتاح الآن بشكل عام. تركز المقالة على تصميم مكافأة مركبة متعددة الخطوات يمكن أن يتعلم منها تحسين السياسة النسبي الجماعي (GRPO)، بما في ذلك مثال عملي لتعليم Amazon Nova Lite 2.0 على السؤال قبل البرمجة في مهمة برمجة تعاونية متعددة الخطوات. يستخدم المثال مكافأة من أربعة مكونات: الصحة (correctness)، والسؤال قبل البرمجة (asked_before_coding)، والتخمين الفوري (guessed_immediately)، وعقوبة الحلقة (loop_penalty). كما يغطي المقال تنفيذ الكود الذي يولده النموذج بأمان، مع احتياطات مثل عدم كشف بيانات الاعتماد أو الشبكة، وتطبيق حدود الموارد، والتحقق من عدد الاختبارات. يناقش قسم المخاطر اختراق المكافأة (reward hacking)، وعدم استقرار التدريب، وانهيار المكافأة، مؤكدًا أن إشارة المكافأة تؤثر على التعلم فقط من خلال التباين داخل مجموعة، لذا فإن المصطلح الذي يأخذ نفس القيمة لكل إكمال لا يساهم بشيء في التدرج. يتم تسليط الضوء على أهمية فتح السلوكيات المرغوبة ومعاقبة أنماط الفشل، بالإضافة إلى الحاجة إلى قياس كل مكوّن للثقة في ما يتعلمه التدريب.
المصدر: AWS ML blog — الأصلي
منشوراتنا السابقة حول هذا الموضوع ↓
أخبار جديدة