Amazon Nova Forgeによるマルチターン強化学習のカスタム報酬関数
Amazon/AWS
Amazon Nova Forgeは、マルチターン強化学習のためのカスタム報酬関数を可能にし、チームが良好な結果の定義を可能にしつつ、サービスがロールアウトと会話状態を調整します。この投稿では、GRPOのための複合マルチターン報酬の設計、モデル生成コードの安全な実行、報酬信号を崩壊させる可能性のある落とし穴について説明しています。
マルチターン強化学習(RL)では、カスタム報酬関数がモデルの学習内容を決定づけます。微妙に誤った報酬は、健全なトレーニング曲線にもかかわらず、誤ったことを教えてしまう可能性があります。Amazon Nova Forgeは、Bring Your Own Orchestration(BYOO)を通じて報酬ロジックをユーザー自身の環境で実行し、サーバーレスのマルチターンRLオプションが現在一般提供されています。この記事では、Group Relative Policy Optimization(GRPO)が学習できる複合マルチターン報酬の設計に焦点を当て、マルチターン協調コーディングタスクにおいてAmazon Nova Lite 2.0にコード作成前に質問することを教える具体例を示します。この例では、正しさ、コード前の質問、即座の推測、ループペナルティという4つの要素からなる報酬を使用します。また、モデルが生成したコードを安全に実行する方法についても説明し、認証情報やネットワークを公開しない、リソース制限を適用する、テスト数を検証するなどの注意点を挙げます。落とし穴のセクションでは、報酬ハッキング、トレーニングの不安定性、報酬の崩壊について議論し、報酬信号がグループ内の変動を通じてのみ学習に影響を与えるため、すべての完了で同じ値を取る項は勾配に寄与しないことを強調します。望ましい行動のゲートを解除し、失敗モードを罰することの重要性を強調するとともに、各要素を計測してトレーニングが何を学習しているかを信頼する必要性を指摘します。
出典: AWS ML blog —
原文
