跳转至

Mitigating False Credit Propagation: Probabilistic Graphical Reward Aggregation for Rubric-Based Reinforcement Learning

一句话结论

GEAR(Graphical Event Aggregation for Rubric rewards)把实例级 rubric 表示为带类型依赖的 DAG,在局部 judge 分数之外,用软概率抑制未被前置条件许可的下游奖励或惩罚,再聚合为归一化的期望有符号效用;在论文的三个开放式 rubric benchmark、两个 policy backbone 和三个 rubric-RL pipeline 上,v2 报告它稳定优于 flat aggregation 与 deterministic gating。论文 §3–§4

要解决的问题

Rubric 常把回答质量拆成多个 criterion,例如事实正确、证据使用、安全和完整性。传统 flat aggregation 将每个 criterion 的局部分数当作独立效用相加,但有些分数只有在另一个条件成立后才有意义:证据使用应以事实有根据为前提;只在回答确实给出临床建议时,遗漏不确定性说明才应产生相应惩罚。若前置条件不成立,flat 仍会计入下游奖励或惩罚,论文将这种结构性错误称为 False Credit Propagation(FCP,虚假信用传播)。它可能把表面满足下游检查的行为强化进 policy,也可能因未被激活的惩罚压低本来有效的回答。论文 §1、§3.1

这是 response-level rubric RL 的奖励聚合问题:局部 judge 可以分别做出合理判断,错误发生在把这些判断压成 scalar reward 时。目标是同时表达依赖、保留不确定情况下的部分信用,并让每次 RL 打分的额外开销可控。论文 §1

先用大白话说

把 rubric 想成一张有先后关系的评分表。先检查“回答是否基于正确事实”,再检查“是否使用了证据”;如果事实基础没有成立,证据使用即使形式上存在,也不应拿到完整加分。GEAR 不是把后一个分数直接归零,而是根据前一个 criterion 的可信度保留一部分:弱依赖保留得多,强依赖保留得少,条件触发则可以完全关闭。父 criterion 自己的分数仍按自己的权重计入,边只调节子 criterion。论文 §3.2–§3.4

问题属于开放式、多目标、依赖结构的 rubric RL;它不重新训练外层 PPO/GRPO,也不替代局部 judge 或 rubric 生成,而是修改 criterion-level 分数到 scalar reward 之间的聚合层。论文 §3.4、§4.1

一个具体例子

设一条 rubric 有两个正权重 criterion:事实有根据(父节点)和 证据使用(子节点),二者之间是 weak prerequisite。局部 judge 给出 p_parent=0.2p_child=0.9,而弱依赖的默认保留系数是 λ=0.6。flat 会直接把子节点按 0.9 计入;GEAR 的近似边门控为 0.2 + (1-0.2)×0.6 = 0.68,于是子节点调整为 q_child=0.9×0.68=0.612。这只是代入论文公式的说明例子,并非论文单独报告的实验样本。论文式 (12)、附录表 7

若子节点是“在给出临床建议时遗漏免责声明”的负权重惩罚,而父节点是“回答确实给出临床建议”的 trigger/activation 条件,则父节点不成立时 λ_act=0 会关闭该条件性惩罚;父节点若成立,子节点仍按自己的局部 judge 分数和负权重计入。论文 §3.2–§3.3

方法拆解

1. 局部 rubric 分数与有符号权重

对查询 x、候选回答 y 和实例级加权 rubric R_x={(r_i,w_i)},每个 criterion 对应二元潜在事件 C_i∈{0,1}。正权重 criterion 的事件表示期望行为出现,负权重 criterion 的事件表示应受罚的错误或违规出现。局部 judge 给出 p_i=J_i(x,y,r_i)∈[0,1],作为 P(C_i=1|x,y,r_i) 的局部估计;它可以是软分数,也可以是二值判断。论文式 (1)–(3)

flat 基线将这些分数视为无序 checklist:

S_flat = Σ_i w_i p_i / Σ_{i:w_i>0} w_i

分母只使用正权重总和;负权重 criterion 会在分子中扣分。论文式 (2)

2. 查询特定的 typed DAG

GEAR 为每个查询和 rubric 构造固定图 G_x=(V_x,E_x),图只由 query 和 rubric 决定,对同一 query 的所有 candidate response 复用,不读取 candidate response 来改图。边从“许可条件”指向“被许可 criterion”,分为三类:

论文术语 官方代码 / README 名称 含义 默认 λ
weak prerequisite weak_prerequisite 父节点不支持时,子节点只做温和抑制 0.6
strong prerequisite strong_prerequisite 父节点不支持时,子节点强抑制 0.2
activation trigger 父节点控制条件性子节点是否适用,可完全关闭 0.0

这些边对正、负权重的子节点都适用:正权重表示下游 credit 被许可,负权重表示惩罚条件被激活。图构建离线进行,v2 附录描述了四步流程:criterion role 分类、按 role 生成候选父子对、judge 判定依赖类型、验证并投影为 DAG。role 为 foundation、bonus、penalty、trigger;候选约束不允许把 bonus/penalty 反向作为 core criterion 的前置条件。论文 §3.2、附录 A

官方 rubric_graph.py 也实现了 role-pair 限制、每对只保留一条优先级最高的边、去除自环/无效边并跳过会成环的边;代码中的 trigger 同时是 node/edge 的允许值。官方图构建代码边清洗与 DAG 处理

3. 单调条件概率模型

每条边 (j,i)λ_ji=F(x,R_x,G_x,j,i)。论文实验为可复现而采用按类型固定的值:λ_wk=0.6λ_st=0.2λ_act=0.0。对 criterion i,给定父节点状态,局部条件概率为:

α_i(C_Pa(i);p_i) = p_i × Π_{j∈Pa(i)} λ_ji^(1-C_j)

父节点为 1 时不抑制,父节点为 0 时保留对应的 λ;因此 P(C_i=1|parents,p_i)=α_i 单调不增于不支持的父状态,且不超过局部分数 p_i。所有局部条件分布在 DAG 上相乘,形成给定局部 judge 分数的 conditional Bayesian network;它不是生成 judge 分数的模型。论文式 (6)–(9)

4. 线性近似与奖励

精确边缘 q_i=P(C_i=1|p) 对多节点图直接求和是指数复杂度。GEAR 用拓扑顺序近似父节点联合矩:

q̂_i = p_i × Π_{j∈Pa(i)} [q̂_j + (1-q̂_j)λ_ji]

单父节点,或多父节点在该条件模型下相互独立时,这个更新是精确的;相关的多父节点则是 mean-field 近似。最后计算归一化期望有符号效用:

S_GEAR = Σ_i w_i q̂_i / Σ_{i:w_i>0} w_i

若所有 λ=1,GEAR 退化为 flat;若选定 λ=0 且父节点决策为二值,相关子节点退化为 hard dependency gating。在线聚合对每个节点和每条边各处理一次,时间 O(K+|E_x|)、存储 O(K),图构建在训练前离线完成。论文式 (10)–(14)、§3.5

官方 gear.py 对输入分数做 [0,1] 截断,按拓扑顺序分别计算 flat、hard 和 DAG 三套 q,并返回各套 reward、节点类型、边和 rubric ID。官方聚合器DAG 更新聚合入口

实验与证据

实验设置与统计口径

  • Policy backbone:Qwen2.5-7B-Instruct、Llama-3.1-8B-Instruct;均用 GRPO 训练。
  • 训练期 reward judge:Qwen3-8B,按 criterion 输出局部分数;最终评测 judge:独立的 Qwen3-32B,只在训练完成后的 held-out validation 上评测,不参与 reward、rollout 选择或梯度更新。论文 §4.1、附录 D
  • Benchmark / 数据切分:HealthBench 4,500 train + HealthBench-500 500 validation;WritingBench 900 train + 100 validation;PLawBench practical case analysis 200 train + 50 validation。每个 query-specific graph 在训练前构建一次并对该 query 的所有 candidate 固定。论文附录 C.1、表 9
  • 聚合对照:同一最小 rubric-RL pipeline 中只替换 scalarization,比较 Flat、Hard 和 GEAR;另在 RaR-Explicit、MeRF、RuscaRL 中只替换 reward aggregation 作为 plug-in。论文 §4.1
  • 训练配置:VERL + GRPO;7 个 RL 节点、每节点 8 张 Ascend 910B NPU;batch 112、PPO mini-batch 56、每个 prompt 8 次 rollout(每 step 896 responses)、350 steps、5 epochs、学习率 1e-6、LoRA rank 16/alpha 32;最大 prompt/response 长度均 4096,rollout 最大长度 8192,KL 系数 1e-3,temperature 0.7、top-p 0.8、top-k 20。论文表 10 说明这些配置对所有聚合变体相同。论文附录 C.2–C.3、表 10
  • 重复运行:主结果每个 policy backbone、方法和 benchmark 均为 3 个独立随机种子;表中分数是 validation rubric score 的均值,附录表 13/14 给出标准差。最终 judge 采用确定性解码;HealthBench 使用满足概率,WritingBench 使用归一化量表分数,PLawBench 使用 partial-credit/subitem wrapper,全部归一化到 [0,1] 后再聚合。论文附录 C.4、D.1–D.4

主结果(v2 表 1;均值,三次独立运行)

以下是论文的完整主表数值。括号为 aggregation-only 相对 Flat 的绝对提升,或 plug-in 相对对应宿主 pipeline 的绝对提升;不是相对百分比。指标均为百分制 validation score。论文表 1

Policy / 设置 方法 HealthBench-500 WritingBench PLawBench Avg.
Qwen2.5-7B Flat 56.7 74.1 68.4 66.4
Qwen2.5-7B Hard 54.6 72.5 65.0 64.0
Qwen2.5-7B GEAR 62.9 (+6.2) 79.6 (+5.5) 75.2 (+6.8) 72.6 (+6.2)
Qwen2.5-7B RaR-Explicit 49.5 67.0 62.3 59.6
Qwen2.5-7B RaR-Explicit + GEAR 55.0 (+5.5) 71.6 (+4.6) 68.8 (+6.5) 65.1 (+5.5)
Qwen2.5-7B MeRF 40.2 61.9 55.7 52.6
Qwen2.5-7B MeRF + GEAR 45.6 (+5.4) 68.7 (+6.8) 60.4 (+4.7) 58.2 (+5.6)
Qwen2.5-7B RuscaRL 58.2 75.4 72.1 68.6
Qwen2.5-7B RuscaRL + GEAR 65.7 (+7.5) 81.5 (+6.1) 76.9 (+4.8) 74.7 (+6.1)
Llama-3.1-8B Flat 54.1 76.2 69.5 66.6
Llama-3.1-8B Hard 53.0 72.7 66.7 64.1
Llama-3.1-8B GEAR 62.5 (+8.4) 82.4 (+6.2) 76.9 (+7.4) 73.9 (+7.3)
Llama-3.1-8B RaR-Explicit 48.4 67.9 63.8 60.0
Llama-3.1-8B RaR-Explicit + GEAR 54.1 (+5.7) 73.6 (+5.7) 70.5 (+6.7) 66.1 (+6.0)
Llama-3.1-8B MeRF 39.5 62.3 58.4 53.4
Llama-3.1-8B MeRF + GEAR 44.7 (+5.2) 69.8 (+7.5) 62.1 (+3.7) 58.9 (+5.5)
Llama-3.1-8B RuscaRL 56.9 76.7 74.2 69.3
Llama-3.1-8B RuscaRL + GEAR 63.8 (+6.9) 85.0 (+8.3) 78.4 (+4.2) 75.7 (+6.5)

aggregation-only 平均分从 66.4→72.6(Qwen)和 66.6→73.9(Llama);Hard 在两个 backbone 都低于 Flat,支持“全硬门控会丢掉带噪 judge 下仍应保留的部分信用”的解释。plug-in 中 RuscaRL + GEAR 平均分最高,分别为 74.7 和 75.7。论文 §4.2

FCP 泄漏与保留

论文定义 violated dependency 为 p_child≥0.5p_parent<0.5,satisfied dependency 为父、子都 ≥0.5L_FCP 是违反依赖时的归一化下游效用,越低越好;P 是满足依赖时保留的子效用比例,越高越好。阈值只用于构造诊断子集,聚合本身仍使用原始局部分数,并同时统计正、负权重子节点。论文 §4.3、附录 F

方法 L_FCP P
Flat 0.0922 1.0000
Hard 0.0000 0.1877
GEAR 0.0032 0.2706

GEAR 相对 Flat 将泄漏从 0.0922 降到 0.0032,即相对下降 96.5%;Hard 的泄漏略低,但只保留 0.1877 的已许可下游效用,GEAR 保留 0.2706。论文表 2、§4.3

图构建和在线开销

统计量 HealthBench WritingBench PLawBench
rubric 数 5,000 1,000 250
平均 criterion / rubric 11.48 5.00 4.00
平均候选边 / rubric 21.36 5.74 3.82
平均保留边 / rubric 10.92 2.86 1.94
平均更新规模(节点+保留边) 22.40 7.86 5.94
非空图比例 91.84% 78.60% 71.20%
每 rubric 无效候选边 0.42 0.18 0.11
judge 后在线聚合延迟 / response 4.1 ms 1.7 ms 1.3 ms

延迟只测局部 judge 已完成后的聚合,不包含生成或 criterion-level judge;图构建是每个 query-specific rubric 离线做一次。论文表 3、附录表 16、附录 G

消融、敏感性与额外验证

HealthBench-500 消融(表 4):Flat 56.7;random graph 55.8(−0.9);untyped graph 60.4(+3.7);typed graph + hard gating 54.6(−2.1);typed graph + soft inference/GEAR 62.9(+6.2)。random rewiring 保持边数和类型频率但不提升,说明任意抑制不足;untyped 图有收益,完整 typed + soft inference 最好。论文表 4、§4.6

全 benchmark 消融(附录表 17):Flat 56.7/74.1/68.4(Avg 66.4);random 55.8/73.4/67.6(65.6);untyped 60.4/77.5/72.0(70.0);typed + hard 54.6/72.5/65.0(64.0);typed + GEAR 62.9/79.6/75.2(72.6)。顺序依次为 HealthBench/WritingBench/PLawBench。论文附录表 17

抑制强度敏感性(附录表 18)γ=0(Flat)Avg 66.4、L_FCP 0.0922;γ=0.5 为 70.7/0.0158;默认 γ=1 为 72.6/0.0032;γ=2 为 71.6/0.0011;γ=4 为 68.0/0.0005。更强抑制继续降泄漏但损害任务分数,默认值给出最佳平均分与泄漏折中。论文 §4.5、附录表 18

多父节点聚合:依赖 criterion 中 70.0% 只有一个父节点、24.4% 有两个、5.6% 有三个及以上,平均 1.37 个父节点。在 Qwen2.5-7B aggregation-only 设置下,product 规则取得 72.6/0.0032(Avg/泄漏),优于 geometric mean 70.5/0.0058、arithmetic mean 69.4/0.0087、maximum support 68.8/0.0146;四种依赖感知变体都超过 Flat 66.4。论文 §4.7

Rubric specification 对比:Original + Flat 的 Qwen/Llama 平均为 66.4/66.6(跨三 benchmark Avg 66.5);Conditional Rewrite + Flat 为 69.9/70.4(Avg 70.2);Original + GEAR 为 72.6/73.9(Avg 73.3)。把条件文字写进 child rubric 能恢复一部分差距,但显式保留父子判断并聚合依赖的 GEAR 仍更高。论文表 5、§4.7

图质量与人审:人工抽查每个 benchmark 60 条、共 180 条保留边;有效边 precision 91.7%,有效边中的 relation-type accuracy 87.3%,两名标注者 pooled Cohen’s κ=0.80。另在人定义的 300 个依赖案例中,GEAR 将 Flat 的违反依赖泄漏 0.082 降至 0.010,同时保留 0.648 的已许可下游效用,Hard 仅保留 0.231。250 对匹配 Flat–GEAR 回答的盲评中,GEAR 在非平局比较中获偏好 72.9%(95% Wilson CI 66.7–78.3%),标注者一致性 κ=0.72。该图审计评估保留边的 precision/type accuracy,不测漏掉依赖的 recall;盲评衡量 rubric alignment 感知,不等于领域专家事实正确性。论文 §4.7

独立 benchmark 评测协议:使用官方 HealthBench + GPT-4.1、发布的 WritingBench critic、发布的 PLawBench + Gemini;两 backbone、三 seeds 平均。Flat/Hard/GEAR 分别为 HealthBench 55.2/53.6/61.5,WritingBench 74.4/72.0/79.8,PLawBench 68.1/65.5/74.4;GEAR 比 Flat 高 6.3、5.4、6.3 分。将 graph builder、训练 reward judge 和最终 evaluator 一并替换为非 Qwen 模型后,GEAR 仍比匹配 Flat 高 5.9 分。论文表 6、§4.7

精确推断一致性(附录表 8):在同一图、局部分数、权重和 λ 下,对小图枚举精确边缘并和拓扑近似比较:HealthBench 5,000 对,平均 criterion 11.48,marginal MAE 0.0068、reward MAE 0.0042、reward correlation 0.9968;WritingBench 1,000 对,5.00,0.0027/0.0018/0.9992;PLawBench 250 对,4.00,0.0019/0.0013/0.9995。论文将其作为近似验证,主 RL 叙述采用线性拓扑更新。论文附录 B.2、表 8

额外 policy backbone(附录表 15):Qwen3-30B-A3B-Instruct aggregation-only 单次运行:Flat 58.4/77.8/71.2(Avg 69.1),Hard 56.5/75.4/68.1(66.7),GEAR 65.1/84.0/78.3(75.8),相对 Flat 提升 6.7 分。该表明确是 single-run,不能与三次重复的主表标准差等同。论文附录 E.3、表 15

标准差与统计口径(v2 附录表 13/14)

主表均值来自三次独立运行;以下保留 v2 附录的标准差,顺序均为 HealthBench-500 / WritingBench / PLawBench / Avg:

  • Qwen2.5-7B aggregation-only:Flat 56.7±0.6 / 74.1±0.4 / 68.4±0.7 / 66.4±0.5;Hard 54.6±0.8 / 72.5±0.5 / 65.0±0.9 / 64.0±0.6;GEAR 62.9±0.5 / 79.6±0.4 / 75.2±0.6 / 72.6±0.4
  • Llama-3.1-8B aggregation-only:Flat 54.1±0.7 / 76.2±0.6 / 69.5±0.8 / 66.6±0.6;Hard 53.0±0.6 / 72.7±0.7 / 66.7±0.9 / 64.1±0.7;GEAR 62.5±0.6 / 82.4±0.5 / 76.9±0.7 / 73.9±0.5
  • Qwen2.5-7B plug-in:RaR 49.5±0.7 / 67.0±0.5 / 62.3±0.8 / 59.6±0.6 → RaR+GEAR 55.0±0.6 / 71.6±0.5 / 68.8±0.7 / 65.1±0.5;MeRF 40.2±0.9 / 61.9±0.7 / 55.7±0.8 / 52.6±0.7 → MeRF+GEAR 45.6±0.8 / 68.7±0.6 / 60.4±0.9 / 58.2±0.6;RuscaRL 58.2±0.6 / 75.4±0.5 / 72.1±0.7 / 68.6±0.5 → RuscaRL+GEAR 65.7±0.5 / 81.5±0.4 / 76.9±0.6 / 74.7±0.4
  • Llama-3.1-8B plug-in:RaR 48.4±0.8 / 67.9±0.6 / 63.8±0.8 / 60.0±0.6 → RaR+GEAR 54.1±0.6 / 73.6±0.5 / 70.5±0.7 / 66.1±0.5;MeRF 39.5±1.0 / 62.3±0.8 / 58.4±0.9 / 53.4±0.8 → MeRF+GEAR 44.7±0.8 / 69.8±0.6 / 62.1±0.9 / 58.9±0.7;RuscaRL 56.9±0.7 / 76.7±0.6 / 74.2±0.7 / 69.3±0.6 → RuscaRL+GEAR 63.8±0.6 / 85.0±0.5 / 78.4±0.6 / 75.7±0.5论文附录表 13、14

实验结果总结

  • 训练/评测模型:policy 为 Qwen2.5-7B-Instruct、Llama-3.1-8B-Instruct,均用 GRPO;训练期 criterion-level reward judge 为 Qwen3-8B,最终 held-out evaluation judge 为独立 Qwen3-32B;附录另以 Qwen3-30B-A3B-Instruct 做单次 aggregation-only 检查。
  • Benchmark / 数据:HealthBench(4,500 train + HealthBench-500 500 validation)、WritingBench(900 + 100)、PLawBench practical case analysis(200 + 50);总计 5,000、1,000、250 条 rubric/query。
  • 对比基线:Flat aggregation、同图 deterministic Hard gating;plug-in 替换实验对 RaR-Explicit、MeRF、RuscaRL 各自的 aggregation step。另有 random graph、untyped graph、Conditional Rewrite、不同多父聚合规则及跨 benchmark evaluator 验证。
  • 指标:百分制 validation rubric score(均值,主表三次独立运行,附录给标准差);FCP leakage L_FCP(低好)与 satisfied-dependency preservation P(高好);图规模、非空图率、无效边率、judge 后聚合延迟;精确/近似推断 MAE 与 reward correlation;人审 precision、relation-type accuracy、Cohen’s κ 和偏好率。
  • 主要结果:aggregation-only Avg:Qwen Flat/Hard/GEAR = 66.4/64.0/72.6,Llama = 66.6/64.1/73.9;GEAR 在三个 benchmark 均胜 Flat/Hard。FCP L_FCP 由 Flat 0.0922 降至 0.0032(相对下降 96.5%),同时 P=0.2706 高于 Hard 的 0.1877。RuscaRL+GEAR Avg 达 Qwen 74.7、Llama 75.7;Qwen3-30B 单次 GEAR Avg 75.8。所有数字为作者报告结果,本次未独立运行。

与 Seed 的关系

GEAR 属于 Rubric RLseed_papers.md 将该 Track 的问题边界写成“多维 reward 压成 scalar reward 会损失 criterion-level 信息”;GEAR 正面处理的是另一种 scalarization 损失:不是只把多个维度平均,而是把 criterion 之间的 prerequisite/activation 结构也从 rubric 中抹平,导致不被许可的信用进入 RL 信号。

它与现有 Seed 的关系是聚合层互补:

  • Open Rubric System 关注实例级 rubric 生成、pairwise criterion 和 meta-rubric 演进;GEAR 假定 rubric 已存在,重点是依赖图与 reward aggregation。
  • Rubric Dropout 通过随机遮蔽 criterion 降低固定 rubric 的 reward hacking;GEAR 通过结构化依赖抑制未被许可的下游 credit,二者可以作为训练期互补 guardrail。
  • GDPO 在多 reward 的 advantage normalization 处保留 reward 维度差异;GEAR 在更早的 criterion-to-scalar 层修正结构依赖。两者都不替代对方。
  • CriPO 试图保留 unexplored/suppressed criterion 的局部 credit;GEAR 试图保留依赖许可下的部分 credit,同时抑制 FCP。一个偏 criterion/token credit,一个偏 rubric graph scalarization。

对本仓库的多模态 Deep Research,可把事实 grounding、citation support、visual grounding、图表与来源一致性建成带依赖的 criteria:例如“图表结论由来源数字支撑”可以依赖“来源数字被正确读取”。这只是迁移建议,GEAR 论文实验没有覆盖图像输入或 Deep Research 任务。

可迁移启示

  1. 把 rubric 关系写成图而非只写清单。 对研究报告,citation support、visual grounding、source consistency 等条件若有明显许可关系,应显式记录父子方向和边类型。
  2. 保留软不确定性。 局部 judge 不是校准概率时,硬门控容易把本应保留的部分信用归零;弱/强 prerequisite 的不同 λ 可先作为可解释的保守策略。
  3. 评估聚合器的泄漏–保留曲线。 除最终报告分数外,同时测违反依赖时的下游效用和满足依赖时的保留比例,避免用“全部归零”伪装成低泄漏。
  4. 图构建与回答评分分开。 同一 query 的图应在看 candidate response 前固定,否则图本身可能把回答信息泄露进 reward。
  5. 先核对父节点相关性再决定近似。 GEAR 的多父节点 product 更新在相关父节点时只是 mean-field;高密度或强相关子图可考虑精确/混合推断。

局限与待核对

  • 关系类型受限:当前模型只表达单调 prerequisite/activation;不覆盖 compensatory、alternative、mutually exclusive、non-monotonic 或 cyclic 关系,也不能补回 rubric 遗漏的 criterion。论文 §6
  • 图质量决定奖励质量:漏边可能留下 FCP,错误边可能压制有效效用;v2 的人审测的是保留边 precision 和 type accuracy,不测遗漏依赖的 recall。FCP 诊断依赖同一套局部 judge 分数和图,不能替代领域专家语义审计。论文 §6、§4.7
  • 固定 λ 未必适合所有任务0.6/0.2/0.0 是跨 benchmark 固定值,不是学习出的 edge-specific calibration;真实任务可能需要按边或按领域学习保留强度。论文附录 B、§6
  • 多父节点近似:父事件相关时式 (12) 是 mean-field;论文小图的 exact-inference agreement 很高,但不等于任意大图都无误差。论文式 (11)–(13)、附录表 8
  • 评测外推有限:实验只有医疗对话、长文写作和法律案例三个开放式领域;人评衡量的是感知的 rubric alignment,不是领域专家事实正确性;没有验证多模态 Deep Research、长程工具轨迹或更多依赖类型。论文 §6
  • v2 与 v1 的版本差异:arXiv 版本历史确认 v2 在 2026-08-26 修订。v1 的 Table 2 将 Hard 泄漏列为 0.0003,v2 改为 0.0000;v2 还新增 §4.7 的多父节点、rubric rewrite、图质量/人审和独立/跨模型评测,以及相应更详细限制。本文全部结果以 v2 为准;v1 仅作为版本差异记录。v1 HTMLv2 HTML版本历史
  • 官方代码快照早于 v2:本次读取的官方 main 快照为 commit 34a3920d8e06cc7d473c598fefd05f88f0323190(2026-06-03),早于论文 v2;仓库只有原始 benchmark 数据、训练脚本和聚合器,没有随 v2 新增结果日志。因此不能声称该快照独立复现 v2 的新增人审、跨评测器或 Qwen3-30B 单次实验。代码快照
  • 代码 API 默认值与论文默认值需核对aggregate_gear_reward(..., lambda_by_edge_type=None) 内部对未提供的 edge type 回退为 1.0,即不施加论文的默认抑制;README 示例和官方训练 shell 显式传入 0.6/0.2/0.0,调用底层 API 时也必须显式传值。聚合器默认与回退README 示例
  • 推断模式存在论文/脚本待核对项:v2 文字称主 RL 使用线性拓扑更新;官方两个训练脚本却显式设置 inference_mode=exact_autoexact_if_num_nodes_le=10,意味着不超过 10 个节点时会枚举精确边缘。需确认发布数字实际使用的配置,再判断这一点是调试遗留还是论文实验协议的一部分。论文附录 B.2HealthBench 训练脚本Writing/PLaw 训练脚本
  • 术语映射:论文使用 activation,v2 附录角色使用 applicability;官方代码和 README 使用 trigger。语义均指条件性 gate,但正式入库时应保留这层映射,避免把代码字段误写成论文原符号。论文 §3.2、附录 A官方代码类型定义
  • 本次未运行上游训练、代码或模型 API:本次精读核对了原文、README、源码和公开配置;论文结果均为作者报告值,不是本机复现。

相关链接