Search, Inspect, Fetch: Exploiting Structure-Aware Boolean Retrieval for Deep-Research Agents¶
- arXiv: 2608.02751
- 版本: v2
- 提交日期: 2026-08-05
- 最后更新: 2026-08-05
- 作者: Shuai Wang et al.
- 主要机构: The University of Queensland;CSIRO
- 主方向:
Data Synthesis - 辅助标签:
structured-retrieval,evidence-selection,context-efficiency,deep-research - 阅读状态: Review Run 精读
一句话结论¶
SIEVE 不再让 Deep Research agent 每次读取整张网页,而是先按字段筛选、检查网页结构,再只取需要的 section,在三套 QA 上同时提高准确率并减少 20.7%–50.6% token。
要解决的问题¶
常见 Search–Visit agent 看到搜索结果后会把整页内容送入上下文。网页真正有用的往往只有一节,导航、重复说明和无关正文会挤占上下文,也让模型更难找出关键证据。
先用大白话说¶
传统方法像为了查一本书中的一句话,每次都把整本书复印给模型。SIEVE 先查目录和章节摘要,再只把相关章节取回来。这样不仅省 token,还能降低无关信息干扰。
这个问题的特点是信息源本来有标题、章节、日期等结构,但普通检索流水线在进入模型前把这些结构压平了。
一个具体例子¶
问题需要某份年度报告里的风险条款。普通 Search–Visit 会读取报告整页;SIEVE 可用 title/section/body 字段组合 Boolean 条件,先看到带 query-focused snippet 的候选章节,再 fetch “Risk Factors” 小节,而不是把其他财务表和导航文本一并塞入上下文。
方法拆解¶
- 用 Boolean Query Language 对 title、section、body、date 等网页字段做 candidate filtering。
- 用 BM25、dense 或融合 ranker 排序,再展示带章节结构和 query-focused snippet 的结果卡。
- agent 只 fetch 选中的 section;保留 zero-hit fallback,避免过严 Boolean 条件导致无结果。
- 构建 HotpotQA、MuSiQue、BrowseComp-Plus 的成对 flat/structured collection,控制证据内容不变,只改变结构是否可寻址。
实验与证据¶
论文比较多个检索器、三种 agent backbone、结构化与扁平化语料,并披露 answer-recovery 与 fallback 的不对称,证据强度高;跨条件结论仍需结合这些限制阅读。
实验结果总结¶
- 训练/评测模型:主 agent 为 Tongyi-DeepResearch-30B-A3B;迁移评测使用 Qwen-AgentWorld-35B-A3B、OpenResearcher-30B-A3B。
- Benchmark / 数据:结构化/扁平化配对的 HotpotQA、MuSiQue、BrowseComp-Plus。
- 对比基线:Search–Visit、Search–AutoRead、直接语料访问(DCI)、BM25/dense/BM25+dense 等检索组合。
- 指标:答案准确率、distinct-token 使用量、LLM 调用数;最多 100 agent steps,每次取 5 个结果,visit/fetch 上限 12K tokens。
- 主要结果:默认 SIEVE 比最强 Search–Visit 在三套数据上分别提高 1.6、3.1、0.7 个准确率点,同时减少 20.7%–50.6% token;收益跨 ranker 和三种 backbone 保持。
与 Seed 的关系¶
SIEVE 不直接生成最终 benchmark,但它提供 evidence-chain 的结构化采集方式。对 MMDR-Bench、HiEviDR-Bench 等需要追踪来源的任务,section-level evidence 比整页文本更适合后续合成和验证。
可迁移启示¶
仓库未来关注的数据管线应保留网页标题、章节路径、日期和片段来源,不要只存扁平文本;附件也可先暴露目录、页码和区域,再按需读取。
局限与待核对¶
- 部分空答案 recovery overlay 覆盖不完整,跨系统比较存在不对称。
- zero-hit fallback 使用近似 BM25,不能把结果解释为纯 Lucene 对比。
- 当前三套任务以短答案 QA 为主,对长报告综合质量的收益仍需验证。
相关链接¶
- Paper HTML: arXiv HTML
- Code: ielab/skim-search-agent
- Dataset / Project: Hugging Face Paper