跳转至

Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent

  • arXiv: 2608.03979
  • 版本: v1
  • 提交日期: 2026-08-04
  • 最后更新: —
  • 作者: Zhen Fang et al.
  • 主要机构: Video-DeepResearch Team(原文未展开机构,待核对)
  • 主方向: Data Synthesis
  • 辅助标签: video-deep-research, trajectory-synthesis, multimodal-grounding, GRPO
  • 阅读状态: Review Run 精读

一句话结论

Video-DeepResearch 把多模态 Deep Research 从静态图片推进到连续视频,并用“先跨帧视觉定位、再开放网页检索”的训练轨迹强制模型真正使用视觉证据。

要解决的问题

视频研究任务不只要看懂单帧,还要跨时间定位实体、选择关键帧、搜索画面中的对象,再把视觉线索和网页知识连接起来。直接套用图片型 Deep Research agent 时,模型常绕过视觉工具,或者凭参数记忆猜答案,表面答对却没有完成真实研究过程。

先用大白话说

用户给出一段比赛视频,问“画面中这位选手此前在哪届赛事获得过什么成绩”。模型不能只搜索题目文字:它得先找到选手出现的关键帧,裁出人脸或号码,通过视觉搜索确认身份,然后查询公开资料。Video-DeepResearch 把前半段视觉取证设成必经步骤,减少模型跳过视频直接猜答案。

这个问题的特点是证据随时间分散、视频冗余很高,而且“最终答案正确”不足以证明模型真的看过视频。

一个具体例子

一段十分钟新闻视频只在第七分钟短暂出现产品包装。普通 agent 可能根据问题关键词直接网页搜索;该方法先调用 Select_Keyframe 找到相关时刻,再用 Crop_Search 定位包装上的品牌或型号,完成视觉 grounding 后才解锁文字搜索与页面访问。

方法拆解

  • 从多领域视频中生成 30K 个 video-grounded QA,并过滤无需工具即可回答的样本。
  • 用 Qwen3.5-397B-A17B 生成轨迹,通过 stage-wise tool unlocking 先开放视觉工具,再开放 Search/Visit。
  • 保留约 7K 条成功轨迹做 SFT,并加入文本 Deep Research 数据保持文字检索能力。
  • 在 2K 个中等难度样本上继续使用 GRPO,让模型探索超过模仿学习上限的工具策略。

实验与证据

论文给出训练数据构造、SFT/GRPO 设置、工具调用分析、主结果和消融,证据强度高。它同时比较 Direct 与 Agentic 设置,可观察正确率提升是否伴随真实视觉工具使用。

实验结果总结

  • 训练/评测模型:Qwen3-VL-30B-A3B-Instruct、Qwen3.5-35B-A3B 为底座;数据生成使用 Qwen3.5-397B-A17B 和 Qwen3.5-35B-A3B;judge 为 Qwen3-VL-30B-A3B-Instruct。
  • Benchmark / 数据:30K video-grounded QA、7K 成功轨迹、2K GRPO 数据;VideoDR-Bench 与 Video-DR。
  • 对比基线:Gemini 2.5 Pro、GPT-5、Claude-4.5-Sonnet、Qwen3.5-397B-A13B、Kimi K2.5,以及未训练的 Qwen 底座。
  • 指标:回答准确率、视觉/文本工具调用次数、分领域准确率。
  • 主要结果:Video-DeepResearch-35B-A3B 平均准确率 64.0%,超过 Claude-4.5-Sonnet 59.0%、Gemini 2.5 Pro 57.5% 和 GPT-5 52.5%;30B-A3B 达 59.3%。

与 Seed 的关系

它直接扩展 TVIR 和 MMDeepResearch-Bench:前两者主要覆盖图片、图表或图文报告,本论文进一步处理视频中的时间定位、跨帧证据和视觉工具轨迹合成。

可迁移启示

多模态数据合成应记录“证据在哪个时间点、哪个区域、通过哪个工具获得”,并加入 tool-free 过滤,防止 benchmark 被参数记忆绕过。附件型研究也可借鉴先解析附件、再开放网页检索的阶段约束。

局限与待核对

  • 摘要写 VideoDR-Bench 有 200 个实例,实验设置又写 100 个 VQA,当前版本口径不一致。
  • 主要机构未在 arXiv HTML 作者行展开,待论文项目页补充。
  • 正确性由模型 judge 判定,视频域外泛化和工具服务变化仍需人工复核。

相关链接