跳转至

TVIR: Building Deep Research Agents Towards Text-Visual Interleaved Report Generation

  • arXiv: 2606.02320
  • 版本: v2
  • 提交日期: 2026-06-01
  • 最后更新: 2026-06-11
  • 作者: Xinkai Ma et al.
  • 主要机构: Nanjing University;Alibaba Group
  • 主方向: Data Synthesis
  • 辅助标签: multimodal-deep-research, text-visual-interleaving, citation-grounding, benchmark
  • 阅读状态: Seed 精读

一句话结论

TVIR 将图表、图片和文字视为同一条 evidence-driven report 的组成部分,提供 100 个专家策划的多模态 Deep Research 任务和一个分层 agent baseline。

要解决的问题

既有 Deep Research benchmark 主要看文本连贯性、深度和 citation support,很少判断视觉元素是否可靠、是否服务于分析子目标、是否与周围文字和来源一致。

先用大白话说

传统 Deep Research 像“只交文字版调研报告”。但真实报告常常需要一张趋势图、一张对比表或一张带来源的图片。难点不是把图片插进去,而是图片必须真的支持某个结论,且读者能追溯它从哪里来。TVIR 把“找图、做图、解释图、核对来源”当成研究任务的一部分。

这个问题的特点是输出是 text 和 visual 的交错组合,错误也有两层:文字说错,以及图和文字/来源互相矛盾。只用文字 judge 会漏掉后一类错误。

一个具体例子

问题是“比较两种电池技术在成本和寿命上的趋势”。合格报告应先搜索数据,再生成带年份和数据来源的 chart,并在正文解释 chart 支持的趋势。随便找一张看起来相关的图片,即使文字写得漂亮,也不算完成任务。

方法拆解

  • TVIR-Bench:100 个专家策划任务,要求视觉元素完成明确 analytical sub-goal。
  • TVIR-Agent:hierarchical multi-agent 流程,依次构造 outline、检索图片、生成带可追溯来源的 chart,再进行 context-aware sequential writing。
  • Dual-path evaluation:Textual Assessment 与 Visual Assessment 并行,覆盖 citation、instruction、writing、analysis、visual composition、caption 和 source consistency 等维度。

实验与证据

在 9 个 Deep Research system 上评测;TVIR-Agent 获得较强总体表现。正文提供任务设计原则、复杂度分层、各指标计算、judge 一致性和消融,适合复用为数据合成与评测模板。

实验结果总结

  • 训练/评测模型:评测 9 个系统:6 个商业系统(Gemini-3-Pro、Grok-4.1-Thinking、Claude-4.5-Sonnet、Perplexity、Genspark、Manus)与 3 个 TVIR-Agent backbone 变体。
  • Benchmark / 数据:TVIR-Bench,100 个专家策划任务,视觉元素需完成明确 analytical sub-goal。
  • 对比基线:上述商业 Deep Research system 与 TVIR-Agent 不同 backbone 变体。
  • 指标:Textual Assessment 与 Visual Assessment,覆盖 citation、instruction、writing、analysis、visual composition、caption、source consistency。
  • 主要结果:TVIR-Agent 获得较强总体表现;精确的系统排名与分项数值待核对。

与 Seed 的关系

这是 Data Synthesis 的核心 Seed,直接对应“要求图文并茂输出”的场景。它也为 Rubric RL 提供可拆分的 visual criteria,为 Harness RSI 提供多阶段报告执行轨迹。

可迁移启示

任务合成不能只生成问题和答案;还要生成视觉子目标、来源链、图文关系和可验证 failure mode。每个视觉元素应有 provenance,而不是装饰性插图。

局限与待核对

  • 100 个任务规模有限,跨语言、跨领域覆盖需核对附录。
  • 视觉质量 judge 仍可能受模型偏好影响;需要人工校准和跨 judge 稳定性。

相关链接