跳转至

From Simple QA to Deep Research: A Verifiable Benchmark Constructed through Iterative Task Evolution

  • arXiv: 2608.02163
  • 版本: v1
  • 提交日期: 2026-08-03
  • 最后更新: —
  • 作者: Can Wang et al.
  • 主要机构: Shandong Key Laboratory of Digital Service Computing Technology and Systems;Alibaba Token Hub;Institute of Computing Technology, Chinese Academy of Sciences;The Hong Kong Polytechnic University
  • 主方向: Data Synthesis
  • 辅助标签: task-evolution, evidence-dag, pointwise-rubric, benchmark
  • 阅读状态: Review Run 精读

一句话结论

论文让一个简单事实题经过多轮探索逐步长成 Deep Research 任务,并让问题、证据 DAG 和 pointwise rubric 同步演进,得到可追溯、可细分评分的 500 题 benchmark。

要解决的问题

高质量 Deep Research 题需要专业知识、多个证据来源和细粒度评分规则,纯人工构建太贵;一次性让模型生成难题和 rubric,又容易产生无法验证的要求、遗漏重要证据或用泛化维度代替任务知识。

先用大白话说

与其直接命令模型“出一道很难的研究题”,不如从一个能答清的简单问题开始。模型先查资料,整理已经确认的事实和推理,再找一条相关但尚未使用的线索,把下一轮问题变难。每轮新增内容都进入证据图和评分点,因此最终题目虽然复杂,仍能追溯每一项为什么要评。

这个问题的特点是答案路径开放,但关键事实和分析覆盖仍需独立验证;难度增长不能以失去可解性为代价。

一个具体例子

简单题只问一项法律何时生效。Explorer 找到法案、认证和实际生效时间;Formalizer 将这些事实整理成依赖 DAG 和检查点;Challenger 再追问“为何普通联邦法律不够、必须修宪”。多轮后,任务从日期查询变成需要多源证据和法律推理的研究报告。

方法拆解

  • 从 NQ-Open 简单事实题开始,用 GPT-5.5 扮演 Explorer、Formalizer、Challenger。
  • Explorer 搜索证据;Formalizer 将 evidential/analytical steps 写成 DAG,并为每个节点生成可验证 checkpoints 和权重。
  • Challenger 只从已经探索但尚未使用的信息中扩展下一轮问题,保持相关、可解。
  • DAG 连续两轮不再变化时停止;同一任务再生成 hints、without-hints、assigned-topic 三种 query。

实验与证据

论文公开 500 个任务、构造成功率、任务结构统计、十模型结果和 100 题人工复核。全部 10,695 个 task-knowledge checkpoints 经过人工检查,证据强度高。

实验结果总结

  • 训练/评测模型:GPT-5.5 构建 benchmark;Qwen3.7-Max 判分;评测 DeepSeek-V4-Pro、Qwen3.7-Max、GLM-5.2、GPT-5.6 Terra、Claude Sonnet 5、Gemini 3.5 Flash 等十个模型。
  • Benchmark / 数据:500 个任务、31 个主题、10 类领域、三种 query;平均 104.85 个 checkpoints。
  • 对比基线:十模型的 agent mode 与无工具 model mode。
  • 指标:evidential 与 analytical checkpoints 的 DAG 加权得分、构造成功率和人工一致性。
  • 主要结果:GPT-5.6 Terra 在 agent mode 三种 query 上分别得 0.86、0.67、0.70;任务演化成功率 96.3%;三位研究者审查 100 题,Fleiss’ κ=0.81。

与 Seed 的关系

它把 Data Synthesis 与 Rubric RL 的连接做得最直接:任务内容、证据结构和 criterion-level rubric 同源演进,补足 TVIR/MMDR-Bench 偏重人工任务与固定评测的路线。

可迁移启示

后续可从用户提供的 Seed 问题或附件出发,逐轮扩展 evidence DAG;rubric 只评最终报告必须覆盖的内容,不强迫模型复现唯一研究路径。

局限与待核对

  • 构建器和主要判分器均为单一模型家族,可能把生成器偏好写入题目与 rubric。
  • 数据目前是文本 Deep Research,未验证图像、视频或复杂附件的 DAG 演进。
  • 500 题取自成功收敛且 DAG 节点最多的样本,可能偏向适合该流水线的任务。

相关链接