GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization¶
- arXiv: 2601.05242
- 版本: v1
- 提交日期: 2026-01-08
- 最后更新: —
- 作者: Shih-Yang Liu et al.
- 主要机构: NVIDIA;Hong Kong University of Science and Technology(HKUST)
- 主方向:
Rubric RL - 辅助标签:
criterion-credit,multi-reward,GRPO,advantage-normalization - 阅读状态: Seed 精读
一句话结论¶
GDPO 对每个 reward 单独做 group-wise normalization,再做 batch-wise advantage normalization,避免多 reward 组合在 GRPO 中塌缩为相同 advantage。
要解决的问题¶
直接把多维 reward 组合后套 GRPO,会让不同 reward 组合经过组内标准化后得到相同或近似相同的训练信号,丢失 reward dimension 的相对差异,导致收敛差、训练不稳定甚至早停。
先用大白话说¶
假设每个回答同时有“答对了吗”和“格式合规吗”两个分数。一个回答可能答对但格式差,另一个格式漂亮但答错。若先把两个分数混在一起再做 GRPO 的组内标准化,几种不同的组合可能被压成同一个 advantage,训练就分不清该奖励哪种行为。GDPO 先分别处理每一列 reward,再合并,保留这两种差异。
这个问题的特点是 reward 不是一个数,而是一组目标;不同目标的尺度、方差和优先级可能完全不同。错误通常发生在 advantage 计算阶段,不一定是 reward model 本身错了。
一个具体例子¶
工具调用任务中,回答 A:正确调用工具但 JSON 多一个字段;回答 B:JSON 完全合规但调用了错误工具。训练者希望两者分别收到“正确性”和“格式”方向的信号。GDPO 对两个 reward 单独归一化,避免把 A、B 都变成一个模糊的“中等好”。
方法拆解¶
设每条 rollout 有多个 reward。GDPO 先按 reward 维度分别计算组内相对信号,再合并并进行 batch-level normalization,使数值范围不随 reward 数量改变。实现位于训练 advantage 计算处,不需要改变 reward model。
实验与证据¶
在 tool calling、math reasoning、coding reasoning 上对比 GRPO,指标同时包含 correctness/bug ratio 和 format/length 等约束。正文图表使用五次运行的 median/IQR;作者报告 GDPO 在各任务上取得更高 reward 与更稳定训练。官方实现支持 HF-TRL、verl、Nemo-RL。
实验结果总结¶
- 训练/评测模型:论文在 tool calling、数学推理和代码推理任务上比较多 reward RL 训练设置;具体 policy backbone 以正文实验表为准(待核对)。
- Benchmark / 数据:tool calling、math reasoning、coding reasoning 三类任务。
- 对比基线:GRPO,以及不同 reward 组合/归一化策略。
- 指标:correctness、bug ratio、format、length 等 reward 维度;五次运行报告 median/IQR。
- 主要结果:GDPO 在三类任务上取得更高 reward 和更稳定训练;精确表格数值待核对。
与 Seed 的关系¶
这是“scalarization 后 criterion-level 信息被破坏”的算法基线。它不改 rubric 生成,而是修正多 reward 到 advantage 的数值通道,可与 OpenRS 的 criterion-wise preference 或 CriPO 的 token-level credit 组合。
可迁移启示¶
多模态 Deep Research 可把 citation、事实、图文一致性、格式等 reward 保持独立归一化,再决定如何聚合;先修 normalization,再讨论权重,能减少“某一维数值尺度主导训练”的假象。
局限与待核对¶
- reward 之间的优先级和冲突仍由训练者定义,GDPO 不解决目标本身不完整的问题。
- 论文任务覆盖工具、数学和代码;对长报告、视觉证据和开放式研究的外推需要实验。
相关链接¶
- Paper HTML: arXiv HTML
- Code: NVlabs/GDPO
- Dataset / Project: 项目页