RechercheAgents 🇺🇸 14.08.2026 20:03

Fonctions de récompense personnalisées pour l'apprentissage par renforcement multi-tours avec Amazon Nova Forge

Amazon/AWSAmazon/AWS
Amazon Nova Forge permet des fonctions de récompense personnalisées pour l'apprentissage par renforcement multi-tours, permettant aux équipes de définir ce qu'est un bon résultat tandis que le service coordonne les déploiements et l'état de la conversation. L'article couvre la conception de récompenses multi-tours composites pour GRPO, l'exécution sécurisée de code généré par modèle, et les pièges qui peuvent effondrer le signal de récompense.
Dans l'apprentissage par renforcement (RL) multi-tours, la fonction de récompense personnalisée détermine ce que le modèle apprend, et une récompense subtilement erronée peut enseigner la mauvaise chose malgré des courbes d'entraînement saines. Amazon Nova Forge exécute la logique de récompense dans votre propre environnement grâce à Bring Your Own Orchestration (BYOO), avec une option RL multi-tours sans serveur désormais généralement disponible. L'article se concentre sur la conception d'une récompense multi-tours composite que l'optimisation de politique relative de groupe (GRPO) peut apprendre, y compris un exemple concret d'apprentissage à Amazon Nova Lite 2.0 à demander avant de coder dans une tâche de codage collaboratif multi-tours. L'exemple utilise une récompense à quatre composantes : exactitude, a_demandé_avant_de_coder, a_deviné_immédiatement et pénalité_de_boucle. Il couvre également l'exécution sécurisée de code généré par le modèle, avec des précautions comme ne pas exposer d'identifiants ou de réseau, appliquer des limites de ressources et valider le nombre de tests. La section sur les pièges aborde le piratage de récompense, l'instabilité d'entraînement et l'effondrement de récompense, soulignant que le signal de récompense n'influence l'apprentissage que par la variation au sein d'un groupe, donc un terme qui prend la même valeur pour chaque achèvement ne contribue rien au gradient. L'importance de ne pas conditionner les comportements souhaités et de pénaliser les modes d'échec est soulignée, ainsi que la nécessité d'instrumenter chaque composante pour faire confiance à ce que l'entraînement apprend.
Source: AWS ML blog — original
Nos articles précédents sur ce sujet ↓
Infos fraîches