TVIR: Building Deep Research Agents Towards Text-Visual Interleaved Report Generation¶
- arXiv: 2606.02320
- 版本: v2
- 提交日期: 2026-06-01
- 最后更新: 2026-06-11
- 作者: Xinkai Ma et al.
- 主要机构: Nanjing University;Alibaba Group
- 主方向:
Data Synthesis - 辅助标签:
multimodal-deep-research,text-visual-interleaving,citation-grounding,benchmark - 阅读状态: Seed 精读
一句话结论¶
TVIR 将图表、图片和文字视为同一条 evidence-driven report 的组成部分,提供 100 个专家策划的多模态 Deep Research 任务和一个分层 agent baseline。
要解决的问题¶
既有 Deep Research benchmark 主要看文本连贯性、深度和 citation support,很少判断视觉元素是否可靠、是否服务于分析子目标、是否与周围文字和来源一致。
先用大白话说¶
传统 Deep Research 像“只交文字版调研报告”。但真实报告常常需要一张趋势图、一张对比表或一张带来源的图片。难点不是把图片插进去,而是图片必须真的支持某个结论,且读者能追溯它从哪里来。TVIR 把“找图、做图、解释图、核对来源”当成研究任务的一部分。
这个问题的特点是输出是 text 和 visual 的交错组合,错误也有两层:文字说错,以及图和文字/来源互相矛盾。只用文字 judge 会漏掉后一类错误。
一个具体例子¶
问题是“比较两种电池技术在成本和寿命上的趋势”。合格报告应先搜索数据,再生成带年份和数据来源的 chart,并在正文解释 chart 支持的趋势。随便找一张看起来相关的图片,即使文字写得漂亮,也不算完成任务。
方法拆解¶
- TVIR-Bench:100 个专家策划任务,要求视觉元素完成明确 analytical sub-goal。
- TVIR-Agent:hierarchical multi-agent 流程,依次构造 outline、检索图片、生成带可追溯来源的 chart,再进行 context-aware sequential writing。
- Dual-path evaluation:Textual Assessment 与 Visual Assessment 并行,覆盖 citation、instruction、writing、analysis、visual composition、caption 和 source consistency 等维度。
实验与证据¶
在 9 个 Deep Research system 上评测;TVIR-Agent 获得较强总体表现。正文提供任务设计原则、复杂度分层、各指标计算、judge 一致性和消融,适合复用为数据合成与评测模板。
实验结果总结¶
- 训练/评测模型:评测 9 个系统:6 个商业系统(Gemini-3-Pro、Grok-4.1-Thinking、Claude-4.5-Sonnet、Perplexity、Genspark、Manus)与 3 个 TVIR-Agent backbone 变体。
- Benchmark / 数据:TVIR-Bench,100 个专家策划任务,视觉元素需完成明确 analytical sub-goal。
- 对比基线:上述商业 Deep Research system 与 TVIR-Agent 不同 backbone 变体。
- 指标:Textual Assessment 与 Visual Assessment,覆盖 citation、instruction、writing、analysis、visual composition、caption、source consistency。
- 主要结果:TVIR-Agent 获得较强总体表现;精确的系统排名与分项数值待核对。
与 Seed 的关系¶
这是 Data Synthesis 的核心 Seed,直接对应“要求图文并茂输出”的场景。它也为 Rubric RL 提供可拆分的 visual criteria,为 Harness RSI 提供多阶段报告执行轨迹。
可迁移启示¶
任务合成不能只生成问题和答案;还要生成视觉子目标、来源链、图文关系和可验证 failure mode。每个视觉元素应有 provenance,而不是装饰性插图。
局限与待核对¶
- 100 个任务规模有限,跨语言、跨领域覆盖需核对附录。
- 视觉质量 judge 仍可能受模型偏好影响;需要人工校准和跨 judge 稳定性。
相关链接¶
- Paper HTML: arXiv HTML
- Code: —
- Dataset / Project: arXiv abstract