Funciones de recompensa personalizadas para aprendizaje por refuerzo multi-turno con Amazon Nova Forge
Amazon/AWS
Amazon Nova Forge permite funciones de recompensa personalizadas para aprendizaje por refuerzo multi-turno, permitiendo a los equipos definir cómo se ve un buen resultado mientras el servicio coordina los despliegues y el estado de la conversación. El artículo cubre el diseño de recompensas multi-turno compuestas para GRPO, la ejecución segura de código generado por modelos y los errores que pueden colapsar la señal de recompensa.
En el aprendizaje por refuerzo (RL) multi-turno, la función de recompensa personalizada determina qué aprende el modelo, y una recompensa sutilmente incorrecta puede enseñar algo equivocado a pesar de que las curvas de entrenamiento sean saludables. Amazon Nova Forge ejecuta la lógica de recompensa en su propio entorno mediante Bring Your Own Orchestration (BYOO), con una opción de RL multi-turno sin servidor que ahora está disponible de forma general. La publicación se centra en diseñar una recompensa multi-turno compuesta que el Grupo de Optimización de Política Relativa (GRPO) pueda aprender, incluido un ejemplo práctico de cómo enseñar a Amazon Nova Lite 2.0 a preguntar antes de codificar en una tarea de codificación colaborativa multi-turno. El ejemplo utiliza una recompensa de cuatro componentes: corrección, preguntó_antes_de_codificar, adivinó_inmediatamente y penalización_por_bucle. También cubre cómo ejecutar código generado por el modelo de forma segura, con precauciones como no exponer credenciales o red, aplicar límites de recursos y validar el número de pruebas. La sección de dificultades aborda el hackeo de recompensas, la inestabilidad del entrenamiento y el colapso de recompensas, enfatizando que una señal de recompensa influye en el aprendizaje solo a través de la variación dentro de un grupo, por lo que un término que toma el mismo valor para cada finalización no contribuye nada al gradiente. Se destaca la importancia de desbloquear los comportamientos deseados y penalizar los modos de fallo, junto con la necesidad de instrumentar cada componente para confiar en lo que el entrenamiento está aprendiendo.
Fuente: AWS ML blog —
original
