Aangepaste beloningsfuncties voor meerarmige versterkend leren met Amazon Nova Forge
Amazon/AWS
Amazon Nova Forge maakt aangepaste beloningsfuncties mogelijk voor meerarmige versterkend leren, waardoor teams kunnen definiëren wat een goed resultaat is terwijl de service rollouts en gespreksstatus coördineert. Het artikel behandelt het ontwerpen van samengestelde meerarmige beloningen voor GRPO, het veilig uitvoeren van modelgegenereerde code en valkuilen die het beloningssignaal kunnen doen instorten.
In multi-turn reinforcement learning (RL) bepaalt de aangepaste rewardfunctie wat het model leert, en een subtiel foutieve reward kan het verkeerde aanleren ondanks gezonde trainingscurves. Amazon Nova Forge voert rewardlogica uit in uw eigen omgeving via Bring Your Own Orchestration (BYOO), met een serverless multi-turn RL-optie die nu algemeen beschikbaar is. Het artikel richt zich op het ontwerpen van een samengestelde multi-turn reward waar Group Relative Policy Optimization (GRPO) van kan leren, inclusief een uitgewerkt voorbeeld van het leren van Amazon Nova Lite 2.0 om te vragen voordat het codeert in een multi-turn collaboratieve codeertaak. Het voorbeeld gebruikt een reward met vier componenten: correctheid, asked_before_coding, guessed_immediately en loop_penalty. Het behandelt ook het veilig uitvoeren van door het model gegenereerde code, met voorzorgsmaatregelen zoals het niet blootstellen van referenties of netwerk, het toepassen van resourcebeperkingen en het valideren van het aantal tests. Het gedeelte over valkuilen bespreekt reward hacking, trainingsinstabiliteit en rewardcollapse, en benadrukt dat een rewardsignaal alleen via variatie binnen een groep invloed heeft op het leren, dus een term die voor elke voltooiing dezelfde waarde heeft, draagt niets bij aan de gradiënt. Het belang van het niet beperken van gewenst gedrag en het bestraffen van faalwijzen wordt benadrukt, evenals de noodzaak om elk onderdeel te instrumenteren om te vertrouwen op wat de training leert.
Bron: AWS ML blog —
origineel
