EvoHarness-RL: Learning Self-Evolving Runtime Harness for Long-Horizon LLM Agents¶
- arXiv: 2608.05446
- 版本: v1
- 提交日期: 2026-08-05
- 最后更新: —
- 作者: Xuying Ning et al.
- 主要机构: Meta AI;University of Illinois Urbana–Champaign
- 主方向:
Harness RSI - 辅助标签:
runtime-harness,harness-policy,BPE-state,GRPO,long-horizon - 阅读状态: Seed 精读
一句话结论¶
EvoHarness-RL 把 runtime harness 当成可学习策略:训练 agent 何时读取、更新和整合外部状态,而不是手写 prompt/heuristic。
要解决的问题¶
长程 agent 需要维护 state、追踪 progress、调用工具、验证结果和复用经验;现有系统通常手工设计 external workspace 及其访问策略,难以适应噪声轨迹和不同任务。
先用大白话说¶
给 agent 一个外部记忆并不够,关键是它要学会“什么时候读、读哪部分、什么时候写、什么时候合并”。如果每一步都读写,成本高且容易把噪声记进去;如果从不读写,又会忘记长期任务状态。EvoHarness-RL 直接训练这套访问策略。
这个问题的特点是模型策略和外部 harness 状态互相影响:策略决定怎样使用状态,状态又决定下一步能看到什么。训练好的策略还要在运行时持续构造和更新状态。
一个具体例子¶
在 ALFWorld 找物品时,agent 第一步记录“钥匙在厨房”,后面不必每步重新搜索;当环境变化或旧记忆不可靠时,它应重新读取并更新。好的 harness policy 会在信息收益大时访问外部状态,在重复动作时省掉调用。
方法拆解¶
- 将 Belief、Progress、Experience (BPE) 暴露为 policy-facing harness state。
- supervised harness fine-tuning 先教会 agent harness action space 与状态构造。
- cost-aware GRPO 再探索 runtime coordination policy,选择性 read/update/consolidate 外部状态。
- 训练中观察 harness annealing,推理中逐渐从频繁调用转向选择性访问;harness evolution 则压缩并改写任务自适应状态。
实验与证据¶
在 ALFWorld、Qwen3-8B 上达到 96.9% success;正文包含 action-specific annealing、coordination learning、消融与 harness grounding 细节。
实验结果总结¶
- 训练/评测模型:Qwen3-8B policy;在 ALFWorld 标准验证集评测。
- Benchmark / 数据:ALFWorld 六类任务:Pick、Look、Clean、Heat、Cool、Pick2。
- 对比基线:冻结 harness、可训练 harness,以及 BPE state 组件和 cost-aware 训练的消融。
- 指标:任务 success rate、harness action 的 annealing 曲线、状态 grounding 与泛化表现。
- 主要结果:达到 96.9% success;训练后从频繁读写转向选择性访问,并在未见环境设置下保持较强表现。
与 Seed 的关系¶
这是 Harness RSI 的 runtime-policy 分支,补足 EvoTrainer 的训练侧演进和 Recuris 的 memory 更新。它也是“skill/tool 使用本身应进入训练目标”的直接证据。
可迁移启示¶
多模态 Deep Research 的 harness state 可显式暴露证据置信度、附件解析状态、citation coverage 和 report progress,再由 policy 学习访问成本与信息收益的平衡。
局限与待核对¶
- 主要实验在 ALFWorld,距离真实网页/附件研究仍有明显 domain gap。
- BPE state 的 schema 和 cost model 需要按 Deep Research 任务重新设计。
相关链接¶
- Paper HTML: arXiv HTML
- Code: —
- Dataset / Project: arXiv abstract