ForschungAgenten 🇺🇸 14.08.2026 20:03

Benutzerdefinierte Belohnungsfunktionen für mehrstufiges Reinforcement Learning mit Amazon Nova Forge

Amazon/AWSAmazon/AWS
Amazon Nova Forge ermöglicht benutzerdefinierte Belohnungsfunktionen für mehrstufiges Reinforcement Learning, sodass Teams definieren können, wie ein gutes Ergebnis aussieht, während der Dienst Rollouts und Gesprächszustand koordiniert. Der Beitrag behandelt das Entwerfen zusammengesetzter mehrstufiger Belohnungen für GRPO, die sichere Ausführung von vom Modell generiertem Code sowie Fallstricke, die das Belohnungssignal zum Kollabieren bringen können.
Beim Multi-Turn Reinforcement Learning (RL) bestimmt die benutzerdefinierte Reward-Funktion, was das Modell lernt, und ein subtil falscher Reward kann trotz gesunder Trainingskurven das Falsche lehren. Amazon Nova Forge führt Reward-Logik in Ihrer eigenen Umgebung über Bring Your Own Orchestration (BYOO) aus, wobei eine serverlose Multi-Turn-RL-Option jetzt allgemein verfügbar ist. Der Beitrag konzentriert sich auf das Design eines zusammengesetzten Multi-Turn-Rewards, aus dem Group Relative Policy Optimization (GRPO) lernen kann, einschließlich eines durchgearbeiteten Beispiels, wie man Amazon Nova Lite 2.0 lehrt, vor dem Codieren zu fragen, in einer Multi-Turn-Aufgabe zur kollaborativen Codierung. Das Beispiel verwendet einen Reward aus vier Komponenten: Korrektheit, vor_dem_Codieren_gefragt, sofort_geraten und Schleifen_Strafe. Es behandelt auch die sichere Ausführung von modellgeneriertem Code mit Vorsichtsmaßnahmen wie dem Nicht-Offenlegen von Anmeldeinformationen oder Netzwerkzugriff, der Anwendung von Ressourcenlimits und der Validierung der Anzahl der Tests. Der Abschnitt über Fallstricke diskutiert Reward-Hacking, Trainingsinstabilität und Reward-Kollaps und betont, dass ein Reward-Signal das Lernen nur durch Variation innerhalb einer Gruppe beeinflusst, sodass ein Term, der für jede Vervollständigung denselben Wert annimmt, nichts zum Gradienten beiträgt. Die Bedeutung des Entsperrens gewünschter Verhaltensweisen und des Bestrafens von Fehlermodi wird hervorgehoben, ebenso wie die Notwendigkeit, jede Komponente zu instrumentieren, um zu vertrauen, was das Training lernt.
Quelle: AWS ML blog — Original
Unsere früheren Beiträge zu diesem Thema ↓
Aktuelle Nachrichten