跳转至

GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization

  • arXiv: 2601.05242
  • 版本: v1
  • 提交日期: 2026-01-08
  • 最后更新: —
  • 作者: Shih-Yang Liu et al.
  • 主要机构: NVIDIA;Hong Kong University of Science and Technology(HKUST)
  • 主方向: Rubric RL
  • 辅助标签: criterion-credit, multi-reward, GRPO, advantage-normalization
  • 阅读状态: Seed 精读

一句话结论

GDPO 对每个 reward 单独做 group-wise normalization,再做 batch-wise advantage normalization,避免多 reward 组合在 GRPO 中塌缩为相同 advantage。

要解决的问题

直接把多维 reward 组合后套 GRPO,会让不同 reward 组合经过组内标准化后得到相同或近似相同的训练信号,丢失 reward dimension 的相对差异,导致收敛差、训练不稳定甚至早停。

先用大白话说

假设每个回答同时有“答对了吗”和“格式合规吗”两个分数。一个回答可能答对但格式差,另一个格式漂亮但答错。若先把两个分数混在一起再做 GRPO 的组内标准化,几种不同的组合可能被压成同一个 advantage,训练就分不清该奖励哪种行为。GDPO 先分别处理每一列 reward,再合并,保留这两种差异。

这个问题的特点是 reward 不是一个数,而是一组目标;不同目标的尺度、方差和优先级可能完全不同。错误通常发生在 advantage 计算阶段,不一定是 reward model 本身错了。

一个具体例子

工具调用任务中,回答 A:正确调用工具但 JSON 多一个字段;回答 B:JSON 完全合规但调用了错误工具。训练者希望两者分别收到“正确性”和“格式”方向的信号。GDPO 对两个 reward 单独归一化,避免把 A、B 都变成一个模糊的“中等好”。

方法拆解

设每条 rollout 有多个 reward。GDPO 先按 reward 维度分别计算组内相对信号,再合并并进行 batch-level normalization,使数值范围不随 reward 数量改变。实现位于训练 advantage 计算处,不需要改变 reward model。

实验与证据

在 tool calling、math reasoning、coding reasoning 上对比 GRPO,指标同时包含 correctness/bug ratio 和 format/length 等约束。正文图表使用五次运行的 median/IQR;作者报告 GDPO 在各任务上取得更高 reward 与更稳定训练。官方实现支持 HF-TRL、verl、Nemo-RL。

实验结果总结

  • 训练/评测模型:论文在 tool calling、数学推理和代码推理任务上比较多 reward RL 训练设置;具体 policy backbone 以正文实验表为准(待核对)。
  • Benchmark / 数据:tool calling、math reasoning、coding reasoning 三类任务。
  • 对比基线:GRPO,以及不同 reward 组合/归一化策略。
  • 指标:correctness、bug ratio、format、length 等 reward 维度;五次运行报告 median/IQR。
  • 主要结果:GDPO 在三类任务上取得更高 reward 和更稳定训练;精确表格数值待核对。

与 Seed 的关系

这是“scalarization 后 criterion-level 信息被破坏”的算法基线。它不改 rubric 生成,而是修正多 reward 到 advantage 的数值通道,可与 OpenRS 的 criterion-wise preference 或 CriPO 的 token-level credit 组合。

可迁移启示

多模态 Deep Research 可把 citation、事实、图文一致性、格式等 reward 保持独立归一化,再决定如何聚合;先修 normalization,再讨论权重,能减少“某一维数值尺度主导训练”的假象。

局限与待核对

  • reward 之间的优先级和冲突仍由训练者定义,GDPO 不解决目标本身不完整的问题。
  • 论文任务覆盖工具、数学和代码;对长报告、视觉证据和开放式研究的外推需要实验。

相关链接