AWS Nova Forge 多轮 RL 上线自定义奖励
AWS Nova Forge 多轮强化学习能力正式可用,支持 BYOO 自定义奖励函数与 GRPO 训练。
Amazon Web Services 近日在官方博客中详细介绍了 Amazon Nova Forge 的多轮强化学习(RL)能力,重点围绕自定义奖励函数的设计与执行机制展开。该能力采用「自带编排(Bring Your Own Orchestration, BYOO)」模式,允许用户在自有环境中运行奖励逻辑,适合需要精细定义「什么是好结果」的智能体训练场景。同时,Nova Forge 也提供了无服务器多轮 RL 选项,现已正式可用(GA),便于不希望自行管理环境的团队快速接入。
多轮强化学习的核心机制
Nova Forge 采用强化微调(Reinforcement Fine-Tuning, RFT)而非监督微调(SFT)的方式来定制 Nova 模型。RFT 不要求预先准备带标注推理路径的样本,而是直接对模型自身输出进行评分并迭代优化。多轮 RFT 将这一思路扩展到智能体场景,覆盖工具调用、代码执行与错误恢复等多步行为,并以整条轨迹的累积奖励作为优化目标,而非单次回答的得分。
在算法层面,Nova Forge 使用 Group Relative Policy Optimization(GRPO)。GRPO 针对每条对话采样 K 条模型输出,由奖励函数对它们进行排序,并依据归一化奖励(即优势度 advantage)来更新模型权重。研究表明,在等算力后训练条件下,RL 在分布外(OOD)任务上的泛化表现优于 SFT,后者甚至会出现退化。
自定义奖励函数的运行方式
Nova Forge 的奖励函数是一段由用户编写的评分代码,而非独立训练的奖励模型。它可以基于规则对输出进行校验(即可验证奖励),也可以调用另一个大语言模型作为评判者(LLM-as-Judge)。
运行方式取决于任务类型:
- 单轮 RFT:将奖励注册为 AWS Lambda 函数,通过 reward_lambda_arn 在训练配置中引用。
- 多轮 RFT:超出 Lambda 15 分钟调用时限,Nova Forge 使用 BYOO 模式。用户设置 rollout.delegate: true,将环境和奖励逻辑部署在例如 Amazon ECS 的容器中。Nova Forge 将每条 rollout 委托给用户环境,收集完成的 episode 用于训练。用户的容器负责管理多轮交互、会话状态、用户模拟器、代码执行与验证器,并返回 aggregate_reward_score 及可选的逐组件 metrics_list。
奖励信号有效性的关键原则
Nova Forge 团队特别强调:奖励信号只有在一个 group 内产生差异时才会影响学习。如果某个奖励项对 group 内所有输出取相同值,它对优势度没有贡献,也不会产生梯度。换言之,形式上存在但实际不变异的奖励项等于零。
围绕这一原则,本文介绍了复合多轮奖励的设计方法、如何在奖励中安全执行模型生成的代码,以及为何应对每个组件进行埋点以便审视训练过程。最后还分享了一次真实训练中暴露的问题:权重最高的奖励项因为实际不产生梯度信号而「静默失效」,以及如何提前发现这类陷阱。
配套基础设施与上手准备
文中示例基于 aws-samples/sample-nova-multi-turn-rl-infra 代码仓库,配套基础设施包括:
- Amazon Nova Forge 订阅(含 Nova Customization SDK 与多轮 RFT API)。
- 基于 Amazon SageMaker HyperPod 的多轮 RFT 集群,部署在客户自管的 Amazon ECS 环境上。
- 用于存放 rollout 数据与检查点的 Amazon S3 存储桶。
在部署时,将 cdk.json 中 use_custom_env 设为「true」并指定 custom_env_id 即可启用自定义奖励环境,默认配置下栈使用内置的 wordle 环境。整体流程与 GRPO、RFT 的熟悉度是阅读与实践的前提。
