From Reasoning to Agentic: Credit Assignment in Reinforcement Learning for Large Language Models¶
- arXiv: 2604.09459
- 版本: arXiv version
- 提交日期: 2026-04-10
- 最后更新: 待核对
- 作者: Chenchen Zhang
- 主要机构: 待核对
- 主方向:
Credit Assignment - 辅助标签:
survey,agentic-RL,taxonomy,benchmark-protocol - 阅读状态: Review Run 精读
一句话结论¶
这篇综述把 LLM RL 的信用分配按“归因粒度”和“方法家族”整理起来,并指出 Agent RL 的多轮、部分可观测和异构动作使传统终局奖励越来越不够用。
要解决的问题¶
同一个最终答案可能由几十到上百次 token 生成、工具调用和环境交互共同产生。只知道最终成功或失败,无法判断哪个步骤应该被强化、哪个步骤应该被惩罚,也难以公平比较不同 credit assignment 方法。
先用大白话说¶
一支球队赢球后,不能把奖金平均发给所有人:有人传出关键球,有人只是跑位,也有人其实差点造成失误。LLM Agent 的一条长轨迹也一样。综述提供了一张地图:奖励可以落到 token、segment、step、turn 或 multi-agent;方法可以用 Monte Carlo、TD、model-based、game-theoretic 或 information-theoretic 思路。
一个具体例子¶
搜索 Agent 最后答对了,但中间调用了十次工具。一次方法可能把奖励均摊到十次调用,另一次只奖励最后一次;counterfactual 方法则会问“如果去掉第三次搜索,最终答案还会正确吗?”不同归因方式会训练出完全不同的搜索策略。
方法拆解¶
- 汇总 2024 年至 2026 年初的 47 种方法,其中 41 种为核心方法、6 种为相邻支持方法。
- 用两维 taxonomy 组织文献:assignment granularity(token、segment、step、turn、multi-agent)与 methodology(Monte Carlo、temporal difference、model-based、game-theoretic、information-theoretic)。
- 提供机器可读的论文清单、baseline family、evidence level 和主要 benchmark。
- 提出 future paper reporting checklist、credit assignment benchmark protocol 和方法选择 decision tree。
实验与证据¶
它不是提出单一训练算法的实验论文,主要贡献是系统分类、文献 inventory 和评测协议。正文还分析 agentic RL 相比 reasoning RL 的新难点,包括随机环境转移、部分可观测、异构 action、不可验证中间状态和 bifurcation point。
实验结果总结¶
- 训练/评测模型:不适用;这是方法综述和评测协议论文。
- Benchmark / 数据:47 种信用分配方法的结构化文献 inventory;提出由 task families、metadata 和 controlled bifurcation tasks 组成的 benchmark protocol。
- 对比基线:跨方法比较不同 baseline family,具体数值对比待核对。
- 指标:方法覆盖范围、证据等级和按场景选择方法的协议维度;不是统一 leaderboard 分数。
- 主要结果:综述认为 Agent RL 正推动 hindsight/counterfactual、privileged asymmetric critic 和 turn-level MDP 等方法发展;这些方法不能简单从单轮 reasoning credit assignment 推出。
与 Seed 的关系¶
它为 IGPO 提供定位:IGPO 属于 information-theoretic、turn-level 的 Agent RL credit assignment。后续仓库可以用这篇综述的 taxonomy 检查是否覆盖了 counterfactual、hierarchical、multi-agent 和 process-reward 路线。
可迁移启示¶
对多模态 Deep Research,评测不能只报告最终报告分数;至少应记录证据发现、视觉 grounding、工具调用和报告修订等粒度,并设计“去掉关键证据节点后是否仍成功”的 controlled bifurcation 测试。
局限与待核对¶
- 综述的 47 篇 inventory 和机构信息需要以论文最终版本及其附录为准。
- benchmark protocol 仍是规范提案,不等于已经有统一公开数据集和 leaderboard。
- 多模态 agentic RL 的 credit assignment 在文中仍属于较新的覆盖方向,不能直接等同于文本搜索实验结论。
相关链接¶
- Paper HTML: arXiv HTML
- Code: —
- Dataset / Project: arXiv abstract