跳转至

MiroEval: Benchmarking Multimodal Deep Research Agents in Process and Outcome

  • arXiv: 2603.28407
  • 版本: v1
  • 提交日期: 2026-03-30
  • 最后更新: —
  • 作者: MiroMind Team
  • 主要机构: MiroMind AI
  • 主方向: Data Synthesis
  • 辅助标签: process-evaluation, multimodal-deep-research, live-benchmark, rubric
  • 阅读状态: Seed 精读

一句话结论

MiroEval 把 Deep Research 评测拆成 synthesis、agentic factuality 和 process 三条互补路径,并用可周期更新的真实用户任务覆盖文本和多模态场景。

要解决的问题

只评最终报告会漏掉搜索、推理和迭代过程;静态 rubric、合成任务和缺少多模态输入又难以反映真实使用,并无法随知识变化刷新。

先用大白话说

两套 agent 最后都写出一篇看起来不错的报告,但第一套真的查了关键来源,第二套只是宽泛搜索后凭语言能力补全。只看最终文章,很难分辨它们。MiroEval 不只给结果打分,还检查 agent 搜了什么、有没有验证、如何修改答案。

这个问题的特点是知识会变化、任务会变化、过程质量和结果质量可能错位;多模态附件还会增加事实核验难度。因此 benchmark 需要能持续更新,而不是一次性静态题库。

一个具体例子

用户要求比较两款产品并附一张趋势图。系统 A 搜索多个一手来源、核对图表数字后写报告;系统 B 搜索很多页面但没有深入验证,最后引用和结论对不上。MiroEval 的 synthesis、factuality、process 三条分数会把这种差异拆出来。

方法拆解

  • 100 个任务:70 个 text-only、30 个 multimodal;采用 dual-path pipeline 支持周期更新。
  • synthesis:task-specific adaptive rubric。
  • factuality:主动检索并联合 web sources 与 multimodal attachments 验证。
  • process:审计系统如何搜索、推理和 refine,而不是只看最终文本。

实验与证据

评估 13 个 system;三维指标揭示不同能力侧面,process quality 对 outcome 有预测力,多模态任务使多数系统下降 3–10 分。三位专家验证 precision 92%,human ranking Kendall’s τ=0.91。

实验结果总结

  • 训练/评测模型:评测 13 个 Deep Research system;MiroThinker-H1 总体最佳,文本任务 77.5、 multimodal 任务 74.5。
  • Benchmark / 数据:100 个任务(70 text-only、30 multimodal),其中 65 个专家策划真实用户任务,35 个文本任务由趋势数据生成。
  • 对比基线:13 个系统横向比较,覆盖商业和研究型 Deep Research agent。
  • 指标:synthesis、factuality、process 三维得分;专家 precision 92%,human ranking Kendall’s τ=0.91。
  • 主要结果:多模态任务使多数系统下降约 3–10 分;MiroThinker-H1 在两类任务均领先,但过程质量与最终结果并不完全等价。

与 Seed 的关系

这是 Data Synthesis 中“任务持续演进 + 过程可评估”的 Seed。对你的仓库,它还提供 Rubric RL 的动态任务来源和 Harness RSI 的过程轨迹接口。

可迁移启示

候选论文筛选不应只看 final report benchmark;若论文能公开 search trace、refinement trace 或可刷新任务生成协议,应提高相关性分数。

局限与待核对

  • 任务数量和真实用户覆盖仍有限;需核对 dual-path 的更新成本。
  • process metric 与最终质量相关不等于因果关系,不能直接据此选择训练策略。

相关链接