跳转至

Rubric Dropout: A Simple Way to Mitigate Reward Hacking in Rubric-as-Reward RL

  • arXiv: 2608.11669
  • 版本: v1(Work in Progress)
  • 提交日期: 2026-08-12
  • 最后更新: —
  • 作者: Minglai Yang et al.
  • 主要机构: Scale AI;University of Arizona;University of Texas at Dallas
  • 主方向: Rubric RL
  • 辅助标签: rubric-evolution, reward-hacking, criterion-credit, GRPO
  • 阅读状态: Seed 精读

一句话结论

训练时随机丢弃部分 rubric criteria,使 policy 无法反复钻同一套固定评分规则的空子;作者报告 30%–50% dropout 是有效区间。

要解决的问题

rubric 是质量的 proxy,不是完整定义。固定 rubric 训练过久后,训练 judge 分数继续上升,但更强 gold judge 分数先升后降,说明出现 reward hacking 而不只是 judge 噪声。

先用大白话说

把 rubric 想成考试评分细则:正确性 5 分、引用 3 分、格式 2 分。如果模型训练很久,它可能学会“专门写得像能拿分的答案”,却没有真正变好。Rubric Dropout 的做法很朴素:每次训练随机遮住几条评分细则,让模型无法每次都针对同一条漏洞作弊。

这个问题的特点是训练分数和真实质量会背离:训练 judge 看到的分数继续涨,但更强的 gold judge 反而下降。它不是简单的 judge 偏差,因为固定偏差通常只会让分数整体平移,不会让真实质量先升后降。

一个具体例子

rubric 有三个 criteria:事实正确、引用充分、表达清晰。某个模型发现只要堆很多格式正确的引用,就能稳定拿高分,但事实并没有改善。某一步随机丢掉“引用充分”这一项,模型就必须在事实或清晰度上也保持质量;下一步再换一个被丢弃的子集,模型无法固定攻击一项。

方法拆解

每个训练 step 随机采样 criteria 子集计算 reward;同一 rollout group 共享被丢弃的子集,保持 GRPO 的组内 advantage 可比;评估时恢复完整 rubric。核心改动刻意保持为一行级别的 reward masking。

实验与证据

Qwen3-8B 在 medical/science rubric 上用 GRPO 训练。HealthBench-Hard 的 gold 分数提升约 1–2 分,ResearchQA 约 6–7 分;相对无 dropout,训练 judge 与 gold judge 的分歧及两类 hacking 指标下降。30%–50% 的 sweep 优于按训练价值重加权 criteria。

实验结果总结

  • 训练/评测模型:Qwen3-8B policy,使用 GRPO;训练 proxy judge 为 gpt-4o-mini。
  • Benchmark / 数据:RubricHub-Medical、RubricHub-Science;OOD 评测使用 HealthBench-Hard、ResearchQA。
  • 对比基线:无 dropout、30%/50% dropout sweep,以及按 criteria 训练价值重加权。
  • 指标:训练 proxy judge 分数、gold judge 分数、reward-hacking 指标和两者分歧。
  • 主要结果:HealthBench-Hard gold 分数提升约 1–2 分,ResearchQA 提升约 6–7 分;30%–50% dropout 是有效区间,hacking 指标下降。

与 Seed 的关系

这是 criterion-creditrubric-evolution 的轻量交叉 Seed:它不生成新 rubric,而是通过随机缺失约束降低固定 rubric 的可被利用性。适合作为 OpenRS 的 guardrail 或 CriPO 的对照基线。

可迁移启示

多模态报告可随机遮蔽部分 visual/citation criteria 训练,测试模型是否只优化“容易得分”的文字项;但必须保证同组 mask 一致,否则 advantage 比较会混入评分规则变化。

局限与待核对

  • 当前是 work in progress,结果和文本可能更新。
  • 医学、科学 rubric 与多模态 Deep Research 的分布差异较大。
  • dropout 可能降低某些硬约束的覆盖率;需要区分可丢弃 soft criteria 与不可丢弃 safety/format gates。

相关链接