Information Gain-based Policy Optimization: A Simple and Effective Approach for Multi-Turn Search Agents¶
- arXiv: 2510.14967
- 版本: arXiv version(后发表于 ICLR 2026)
- 提交日期: 2025-10-16
- 最后更新: 待核对
- 作者: Guoqing Wang, Sunhao Dai, Guangze Ye, Zeyu Gan, Wei Yao, Yong Deng, Xiaofeng Wu, Zhenzhe Ying
- 主要机构: Ant Group Venus Team;Renmin University of China;Individual Author
- 主方向:
Credit Assignment - 辅助标签:
IGPO,information-gain,turn-level-credit,multi-turn-search,agentic-RL - 阅读状态: Seed 精读
一句话结论¶
IGPO 不等到多轮搜索结束才给一个总分,而是用模型对正确答案的概率提升量给每一轮搜索分配奖励,从而缓解长轨迹中的 credit assignment 和 advantage collapse。
要解决的问题¶
多轮搜索 Agent 通常只有最终答案对错这一条奖励。轨迹越长,越难判断哪一次搜索、阅读或整理真正带来了进步;如果一组 rollout 最终结果相同,GRPO 一类方法还可能得到几乎一样的 advantage,训练信号接近于零。
先用大白话说¶
像带学生做开放题:只在最后看“答对/答错”,老师不知道学生在哪一步找到关键线索。IGPO 每轮都问一次“看完这条信息后,模型对正确答案是不是更有把握了?增加了多少?”这部分增加量就是这一轮的即时奖励,再和最终答案奖励一起训练。
这个问题的特点是长程、多轮、工具交互和稀疏结果奖励;它不是简单把总分平均分给所有动作,而是利用模型自身的 belief update 构造密集信号。
一个具体例子¶
问题需要先找到某人的出生地,再用出生地确认其所在国家。第一轮搜索得到候选人物,模型对最终答案的概率从 0.10 上升到 0.35;第二轮搜索只是重复已有信息,概率只升到 0.36。IGPO 会让第一轮获得更大的 information-gain reward,而不是把两轮都视为同样有用。论文并非用这个具体人物例子做实验,这里只是解释奖励含义。
方法拆解¶
- Turn-level belief update:把每次环境交互视为一次信息获取。
- Intrinsic information gain:计算当前轮之后模型生成 ground-truth answer 的概率相对前一轮增加了多少;实现支持 probability difference 或 log-probability difference。
- Outcome + intrinsic reward:把最终答案监督和每轮 information gain 组合成 dense reward trajectory。
- 与 GRPO 结合:在 rollout group 中使用这些更细的 turn-level 信号,缓解所有轨迹只共享一个终局分数的问题。
实验与证据¶
论文摘要报告了 in-domain 与 out-of-domain 的多轮搜索实验,结论是 IGPO 相比强基线取得更高准确率和更高 sample efficiency。官方代码公开了训练/评测脚本、Qwen 系列模型支持,以及 reward normalization 和 curriculum learning 配置。
实验结果总结¶
- 训练/评测模型:官方代码当前支持 Qwen 系列,例如 Qwen2.5-7B-Instruct;论文完整实验中的 backbone 型号待核对。
- Benchmark / 数据:多轮搜索训练与评测数据;具体 benchmark 名称和规模待核对。作者后续代码说明将 IGPO 扩展到 200+ turn 的 Deep Research,并报告 BrowseComp、BrowseComp-ZH 结果,但这属于后续项目更新,不等同于原论文实验。
- 对比基线:依赖终局奖励的多轮 agent RL 方法,以及其他 process-level reward 方法;精确基线列表待核对。
- 指标:答案准确率、word-level F1 和 sample efficiency;完整数值待核对。
- 主要结果:在 in-domain 和 out-of-domain 多轮场景中,IGPO 摘要报告持续优于强基线;具体提升幅度待核对。
与 Seed 的关系¶
这是本仓库 Credit Assignment 模块的核心 Seed。它把“最终 scalar reward 看不出哪一步有效”具体落到 turn-level intrinsic reward,并为后续比较 token、step、turn、counterfactual 等归因方法提供了基线。
可迁移启示¶
对多模态 Deep Research,可以把每轮检索到的新图像证据、图表解释或 citation-grounded claim 对最终报告正确性的增量作为辅助信号,再与 rubric criterion-level reward 结合。需要额外防止“提高答案概率但引入错误视觉证据”的情况,因此不能只使用语言模型概率增量。
局限与待核对¶
- information gain 依赖模型对 ground-truth answer 的概率估计,答案不可验证或存在多种等价表述时需要重新定义目标。
- 模型自身的 belief update 可能把错误但自信的方向当成进步,仍需外部证据或 rubric 校验。
- 本页实验数字、完整 benchmark 和基线列表待根据论文正文进一步核对。
相关链接¶
- Paper HTML: arXiv HTML
- Code: Official IGPO repository
- Dataset / Project: arXiv abstract