아마존 노바 포지로 다중 턴 강화 학습을 위한 맞춤형 보상 함수
Amazon/AWS
아마존 노바 포지는 다중 턴 강화 학습을 위한 맞춤형 보상 함수를 지원하여, 팀이 좋은 결과가 무엇인지 정의할 수 있게 하며 서비스가 롤아웃과 대화 상태를 조정합니다. 이 게시물은 GRPO를 위한 복합 다중 턴 보상 설계, 모델 생성 코드의 안전한 실행, 그리고 보상 신호를 붕괴시킬 수 있는 함정을 다룹니다.
다중 턴 강화 학습(Reinforcement Learning, RL)에서 사용자 정의 보상 함수는 모델이 학습하는 내용을 결정하며, 미묘하게 잘못된 보상은 훈련 곡선이 정상적으로 보여도 잘못된 것을 가르칠 수 있습니다. Amazon Nova Forge는 Bring Your Own Orchestration(BYOO)을 통해 사용자 환경에서 보상 로직을 실행하며, 서버리스 다중 턴 RL 옵션이 이제 일반적으로 사용 가능합니다. 이 게시물은 Group Relative Policy Optimization(GRPO)이 학습할 수 있는 복합 다중 턴 보상을 설계하는 데 초점을 맞추며, 다중 턴 협업 코딩 작업에서 Amazon Nova Lite 2.0에게 코딩 전에 질문하도록 가르치는 실제 예제를 포함합니다. 이 예제는 네 가지 구성 요소로 이루어진 보상을 사용합니다: 정확성, 코딩 전 질문 여부, 즉시 추측 여부, 루프 패널티. 또한 모델이 생성한 코드를 안전하게 실행하는 방법을 다루며, 자격 증명이나 네트워크를 노출하지 않는 것, 리소스 제한 적용, 테스트 수 검증과 같은 예방 조치를 포함합니다. 함정 섹션에서는 보상 해킹, 훈련 불안정성, 보상 붕괴에 대해 논의하며, 보상 신호가 그룹 내 변동을 통해서만 학습에 영향을 미치므로 모든 완료에 대해 동일한 값을 갖는 항목은 기울기에 기여하지 않는다는 점을 강조합니다. 원하는 행동을 게이트 해제하고 실패 모드를 패널티하는 것의 중요성이 강조되며, 각 구성 요소를 계측하여 훈련이 학습하는 내용을 신뢰할 필요가 있습니다.
출처: AWS ML blog —
원문
