跳转至

EvoHarness-RL: Learning Self-Evolving Runtime Harness for Long-Horizon LLM Agents

  • arXiv: 2608.05446
  • 版本: v1
  • 提交日期: 2026-08-05
  • 最后更新: —
  • 作者: Xuying Ning et al.
  • 主要机构: Meta AI;University of Illinois Urbana–Champaign
  • 主方向: Harness RSI
  • 辅助标签: runtime-harness, harness-policy, BPE-state, GRPO, long-horizon
  • 阅读状态: Seed 精读

一句话结论

EvoHarness-RL 把 runtime harness 当成可学习策略:训练 agent 何时读取、更新和整合外部状态,而不是手写 prompt/heuristic。

要解决的问题

长程 agent 需要维护 state、追踪 progress、调用工具、验证结果和复用经验;现有系统通常手工设计 external workspace 及其访问策略,难以适应噪声轨迹和不同任务。

先用大白话说

给 agent 一个外部记忆并不够,关键是它要学会“什么时候读、读哪部分、什么时候写、什么时候合并”。如果每一步都读写,成本高且容易把噪声记进去;如果从不读写,又会忘记长期任务状态。EvoHarness-RL 直接训练这套访问策略。

这个问题的特点是模型策略和外部 harness 状态互相影响:策略决定怎样使用状态,状态又决定下一步能看到什么。训练好的策略还要在运行时持续构造和更新状态。

一个具体例子

在 ALFWorld 找物品时,agent 第一步记录“钥匙在厨房”,后面不必每步重新搜索;当环境变化或旧记忆不可靠时,它应重新读取并更新。好的 harness policy 会在信息收益大时访问外部状态,在重复动作时省掉调用。

方法拆解

  • Belief、Progress、Experience (BPE) 暴露为 policy-facing harness state。
  • supervised harness fine-tuning 先教会 agent harness action space 与状态构造。
  • cost-aware GRPO 再探索 runtime coordination policy,选择性 read/update/consolidate 外部状态。
  • 训练中观察 harness annealing,推理中逐渐从频繁调用转向选择性访问;harness evolution 则压缩并改写任务自适应状态。

实验与证据

在 ALFWorld、Qwen3-8B 上达到 96.9% success;正文包含 action-specific annealing、coordination learning、消融与 harness grounding 细节。

实验结果总结

  • 训练/评测模型:Qwen3-8B policy;在 ALFWorld 标准验证集评测。
  • Benchmark / 数据:ALFWorld 六类任务:Pick、Look、Clean、Heat、Cool、Pick2。
  • 对比基线:冻结 harness、可训练 harness,以及 BPE state 组件和 cost-aware 训练的消融。
  • 指标:任务 success rate、harness action 的 annealing 曲线、状态 grounding 与泛化表现。
  • 主要结果:达到 96.9% success;训练后从频繁读写转向选择性访问,并在未见环境设置下保持较强表现。

与 Seed 的关系

这是 Harness RSI 的 runtime-policy 分支,补足 EvoTrainer 的训练侧演进和 Recuris 的 memory 更新。它也是“skill/tool 使用本身应进入训练目标”的直接证据。

可迁移启示

多模态 Deep Research 的 harness state 可显式暴露证据置信度、附件解析状态、citation coverage 和 report progress,再由 policy 学习访问成本与信息收益的平衡。

局限与待核对

  • 主要实验在 ALFWorld,距离真实网页/附件研究仍有明显 domain gap。
  • BPE state 的 schema 和 cost model 需要按 Deep Research 任务重新设计。

相关链接