Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent¶
- arXiv: 2608.03979
- 版本: v1
- 提交日期: 2026-08-04
- 最后更新: —
- 作者: Zhen Fang et al.
- 主要机构: Video-DeepResearch Team(原文未展开机构,待核对)
- 主方向:
Data Synthesis - 辅助标签:
video-deep-research,trajectory-synthesis,multimodal-grounding,GRPO - 阅读状态: Review Run 精读
一句话结论¶
Video-DeepResearch 把多模态 Deep Research 从静态图片推进到连续视频,并用“先跨帧视觉定位、再开放网页检索”的训练轨迹强制模型真正使用视觉证据。
要解决的问题¶
视频研究任务不只要看懂单帧,还要跨时间定位实体、选择关键帧、搜索画面中的对象,再把视觉线索和网页知识连接起来。直接套用图片型 Deep Research agent 时,模型常绕过视觉工具,或者凭参数记忆猜答案,表面答对却没有完成真实研究过程。
先用大白话说¶
用户给出一段比赛视频,问“画面中这位选手此前在哪届赛事获得过什么成绩”。模型不能只搜索题目文字:它得先找到选手出现的关键帧,裁出人脸或号码,通过视觉搜索确认身份,然后查询公开资料。Video-DeepResearch 把前半段视觉取证设成必经步骤,减少模型跳过视频直接猜答案。
这个问题的特点是证据随时间分散、视频冗余很高,而且“最终答案正确”不足以证明模型真的看过视频。
一个具体例子¶
一段十分钟新闻视频只在第七分钟短暂出现产品包装。普通 agent 可能根据问题关键词直接网页搜索;该方法先调用 Select_Keyframe 找到相关时刻,再用 Crop_Search 定位包装上的品牌或型号,完成视觉 grounding 后才解锁文字搜索与页面访问。
方法拆解¶
- 从多领域视频中生成 30K 个 video-grounded QA,并过滤无需工具即可回答的样本。
- 用 Qwen3.5-397B-A17B 生成轨迹,通过 stage-wise tool unlocking 先开放视觉工具,再开放 Search/Visit。
- 保留约 7K 条成功轨迹做 SFT,并加入文本 Deep Research 数据保持文字检索能力。
- 在 2K 个中等难度样本上继续使用 GRPO,让模型探索超过模仿学习上限的工具策略。
实验与证据¶
论文给出训练数据构造、SFT/GRPO 设置、工具调用分析、主结果和消融,证据强度高。它同时比较 Direct 与 Agentic 设置,可观察正确率提升是否伴随真实视觉工具使用。
实验结果总结¶
- 训练/评测模型:Qwen3-VL-30B-A3B-Instruct、Qwen3.5-35B-A3B 为底座;数据生成使用 Qwen3.5-397B-A17B 和 Qwen3.5-35B-A3B;judge 为 Qwen3-VL-30B-A3B-Instruct。
- Benchmark / 数据:30K video-grounded QA、7K 成功轨迹、2K GRPO 数据;VideoDR-Bench 与 Video-DR。
- 对比基线:Gemini 2.5 Pro、GPT-5、Claude-4.5-Sonnet、Qwen3.5-397B-A13B、Kimi K2.5,以及未训练的 Qwen 底座。
- 指标:回答准确率、视觉/文本工具调用次数、分领域准确率。
- 主要结果:Video-DeepResearch-35B-A3B 平均准确率 64.0%,超过 Claude-4.5-Sonnet 59.0%、Gemini 2.5 Pro 57.5% 和 GPT-5 52.5%;30B-A3B 达 59.3%。
与 Seed 的关系¶
它直接扩展 TVIR 和 MMDeepResearch-Bench:前两者主要覆盖图片、图表或图文报告,本论文进一步处理视频中的时间定位、跨帧证据和视觉工具轨迹合成。
可迁移启示¶
多模态数据合成应记录“证据在哪个时间点、哪个区域、通过哪个工具获得”,并加入 tool-free 过滤,防止 benchmark 被参数记忆绕过。附件型研究也可借鉴先解析附件、再开放网页检索的阶段约束。
局限与待核对¶
- 摘要写 VideoDR-Bench 有 200 个实例,实验设置又写 100 个 VQA,当前版本口径不一致。
- 主要机构未在 arXiv HTML 作者行展开,待论文项目页补充。
- 正确性由模型 judge 判定,视频域外泛化和工具服务变化仍需人工复核。
相关链接¶
- Paper HTML: arXiv HTML
- Code: Osilly/Vision-DeepResearch
- Dataset / Project: Hugging Face Paper