अमेज़न नोवा फोर्ज के साथ मल्टी-टर्न रीइन्फोर्समेंट लर्निंग के लिए कस्टम रिवॉर्ड फंक्शन
Amazon/AWS
अमेज़न नोवा फोर्ज मल्टी-टर्न रीइन्फोर्समेंट लर्निंग के लिए कस्टम रिवॉर्ड फंक्शन सक्षम बनाता है, जिससे टीमें परिभाषित कर सकती हैं कि एक अच्छा परिणाम कैसा दिखता है जबकि सेवा रोलआउट और वार्तालाप स्थिति का समन्वय करती है। पोस्ट में GRPO के लिए समग्र मल्टी-टर्न रिवॉर्ड डिज़ाइन करने, मॉडल-जनित कोड को सुरक्षित रूप से निष्पादित करने और उन नुकसानों को कवर किया गया है जो रिवॉर्ड सिग्नल को ध्वस्त कर सकते हैं।
मल्टी-टर्न रीइंफोर्समेंट लर्निंग (आरएल) में, कस्टम रिवॉर्ड फ़ंक्शन यह निर्धारित करता है कि मॉडल क्या सीखता है, और एक सूक्ष्म रूप से गलत रिवॉर्ड सही चीज़ सिखाने के बजाय गलत चीज़ सिखा सकता है, भले ही प्रशिक्षण वक्र स्वस्थ दिखें। Amazon Nova Forge आपके अपने वातावरण में Bring Your Own Orchestration (BYOO) के माध्यम से रिवॉर्ड लॉजिक चलाता है, जिसमें अब सर्वर-रहित मल्टी-टर्न आरएल विकल्प सामान्य रूप से उपलब्ध है। यह पोस्ट एक समग्र मल्टी-टर्न रिवॉर्ड डिज़ाइन करने पर केंद्रित है जिसे Group Relative Policy Optimization (GRPO) सीख सकता है, जिसमें Amazon Nova Lite 2.0 को मल्टी-टर्न सहयोगी कोडिंग कार्य में कोड करने से पहले पूछना सिखाने का एक कार्यशील उदाहरण शामिल है। उदाहरण में चार-घटक वाला रिवॉर्ड उपयोग किया गया है: सहीता, कोड से पहले पूछा गया, तुरंत अनुमान लगाया, और लूप दंड। यह मॉडल-जनित कोड को सुरक्षित रूप से निष्पादित करने के बारे में भी चर्चा करता है, जिसमें क्रेडेंशियल या नेटवर्क उजागर न करने, संसाधन सीमाएँ लागू करने और परीक्षणों की संख्या को मान्य करने जैसी सावधानियाँ शामिल हैं। नुकसान अनुभाग रिवॉर्ड हैकिंग, प्रशिक्षण अस्थिरता और रिवॉर्ड संकुचन पर चर्चा करता है, इस बात पर जोर देते हुए कि एक रिवॉर्ड सिग्नल केवल एक समूह के भीतर भिन्नता के माध्यम से सीखने को प्रभावित करता है, इसलिए एक ऐसा पद जो हर पूर्णता के लिए समान मान लेता है, वह ग्रेडिएंट में कुछ भी योगदान नहीं देता है। वांछित व्यवहार को अन-गेट करने और विफलता मोड को दंडित करने के महत्व पर प्रकाश डाला गया है, साथ ही प्रशिक्षण क्या सीख रहा है, उस पर भरोसा करने के लिए प्रत्येक घटक को इंस्ट्रूमेंट करने की आवश्यकता पर भी बल दिया गया है।
स्रोत: AWS ML blog —
मूल
