使用Amazon Nova Forge为多轮强化学习定制奖励函数
Amazon/AWS
Amazon Nova Forge支持为多轮强化学习定制奖励函数,允许团队定义什么样的结果算好,而服务负责协调回合并管理对话状态。该文章涵盖了为GRPO设计复合多轮奖励、安全执行模型生成代码,以及可能导致奖励信号崩溃的陷阱。
在多轮强化学习(RL)中,自定义奖励函数决定了模型学习的内容,而一个微妙错误的奖励即使训练曲线健康,也可能教会模型错误的事情。Amazon Nova Forge 通过“自带编排”(BYOO)在你的环境中运行奖励逻辑,并且现在提供了普遍可用的无服务器多轮 RL 选项。本文重点介绍如何设计一个复合多轮奖励,使组相对策略优化(GRPO)能够从中学习,包括一个教 Amazon Nova Lite 2.0 在多轮协作编码任务中先提问再编码的实例。该实例使用了四个组成部分的奖励:正确性、先提问再编码、立即猜测和循环惩罚。文章还讨论了安全执行模型生成代码的问题,包括不暴露凭据或网络、应用资源限制以及验证测试数量等预防措施。陷阱部分讨论了奖励黑客、训练不稳定性和奖励崩溃,强调奖励信号只能通过组内的变异性影响学习,因此对于每次生成结果都取相同值的项对梯度没有任何贡献。文章强调了取消对期望行为的限制和对失败模式进行惩罚的重要性,以及需要对每个组成部分进行度量以信任训练所学内容。
来源: AWS ML blog —
原文
