PesquisaAgentes 🇺🇸 14.08.2026 20:03

Funções de Recompensa Personalizadas para Aprendizado por Reforço Multiturno com Amazon Nova Forge

Amazon/AWSAmazon/AWS
O Amazon Nova Forge permite funções de recompensa personalizadas para aprendizado por reforço multiturno, permitindo que as equipes definam como é um bom resultado enquanto o serviço coordena os rollouts e o estado da conversa. O post aborda o design de recompensas multiturno compostas para GRPO, execução segura de código gerado por modelo e armadilhas que podem colapsar o sinal de recompensa.
Em aprendizado por reforço (RL) multi-turno, a função de recompensa personalizada determina o que o modelo aprende, e uma recompensa sutilmente errada pode ensinar a coisa errada, apesar de curvas de treinamento saudáveis. O Amazon Nova Forge executa a lógica de recompensa no seu próprio ambiente por meio do Bring Your Own Orchestration (BYOO), com uma opção de RL multi-turno sem servidor agora geralmente disponível. O post foca no design de uma recompensa multi-turno composta que o Group Relative Policy Optimization (GRPO) possa aprender, incluindo um exemplo prático de ensinar o Amazon Nova Lite 2.0 a perguntar antes de codificar em uma tarefa de codificação colaborativa multi-turno. O exemplo usa uma recompensa de quatro componentes: correção, perguntou_antes_de_codificar, adivinhou_imediatamente e penalidade_de_loop. Também aborda a execução segura de código gerado pelo modelo, com precauções como não expor credenciais ou rede, aplicando limites de recursos e validando o número de testes. A seção de armadilhas discute hacking de recompensa, instabilidade de treinamento e colapso de recompensa, enfatizando que um sinal de recompensa influencia o aprendizado apenas por meio da variação dentro de um grupo, então um termo que assume o mesmo valor para cada conclusão não contribui nada para o gradiente. A importância de desbloquear comportamentos desejados e penalizar modos de falha é destacada, juntamente com a necessidade de instrumentar cada componente para confiar no que o treinamento está aprendendo.
Fonte: AWS ML blog — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas