MiroEval: Benchmarking Multimodal Deep Research Agents in Process and Outcome¶
- arXiv: 2603.28407
- 版本: v1
- 提交日期: 2026-03-30
- 最后更新: —
- 作者: MiroMind Team
- 主要机构: MiroMind AI
- 主方向:
Data Synthesis - 辅助标签:
process-evaluation,multimodal-deep-research,live-benchmark,rubric - 阅读状态: Seed 精读
一句话结论¶
MiroEval 把 Deep Research 评测拆成 synthesis、agentic factuality 和 process 三条互补路径,并用可周期更新的真实用户任务覆盖文本和多模态场景。
要解决的问题¶
只评最终报告会漏掉搜索、推理和迭代过程;静态 rubric、合成任务和缺少多模态输入又难以反映真实使用,并无法随知识变化刷新。
先用大白话说¶
两套 agent 最后都写出一篇看起来不错的报告,但第一套真的查了关键来源,第二套只是宽泛搜索后凭语言能力补全。只看最终文章,很难分辨它们。MiroEval 不只给结果打分,还检查 agent 搜了什么、有没有验证、如何修改答案。
这个问题的特点是知识会变化、任务会变化、过程质量和结果质量可能错位;多模态附件还会增加事实核验难度。因此 benchmark 需要能持续更新,而不是一次性静态题库。
一个具体例子¶
用户要求比较两款产品并附一张趋势图。系统 A 搜索多个一手来源、核对图表数字后写报告;系统 B 搜索很多页面但没有深入验证,最后引用和结论对不上。MiroEval 的 synthesis、factuality、process 三条分数会把这种差异拆出来。
方法拆解¶
- 100 个任务:70 个 text-only、30 个 multimodal;采用 dual-path pipeline 支持周期更新。
- synthesis:task-specific adaptive rubric。
- factuality:主动检索并联合 web sources 与 multimodal attachments 验证。
- process:审计系统如何搜索、推理和 refine,而不是只看最终文本。
实验与证据¶
评估 13 个 system;三维指标揭示不同能力侧面,process quality 对 outcome 有预测力,多模态任务使多数系统下降 3–10 分。三位专家验证 precision 92%,human ranking Kendall’s τ=0.91。
实验结果总结¶
- 训练/评测模型:评测 13 个 Deep Research system;MiroThinker-H1 总体最佳,文本任务 77.5、 multimodal 任务 74.5。
- Benchmark / 数据:100 个任务(70 text-only、30 multimodal),其中 65 个专家策划真实用户任务,35 个文本任务由趋势数据生成。
- 对比基线:13 个系统横向比较,覆盖商业和研究型 Deep Research agent。
- 指标:synthesis、factuality、process 三维得分;专家 precision 92%,human ranking Kendall’s τ=0.91。
- 主要结果:多模态任务使多数系统下降约 3–10 分;MiroThinker-H1 在两类任务均领先,但过程质量与最终结果并不完全等价。
与 Seed 的关系¶
这是 Data Synthesis 中“任务持续演进 + 过程可评估”的 Seed。对你的仓库,它还提供 Rubric RL 的动态任务来源和 Harness RSI 的过程轨迹接口。
可迁移启示¶
候选论文筛选不应只看 final report benchmark;若论文能公开 search trace、refinement trace 或可刷新任务生成协议,应提高相关性分数。
局限与待核对¶
- 任务数量和真实用户覆盖仍有限;需核对 dual-path 的更新成本。
- process metric 与最终质量相关不等于因果关系,不能直接据此选择训练策略。
相关链接¶
- Paper HTML: arXiv HTML
- Code: MiroMindAI/MiroEval
- Dataset / Project: 项目主页