跳转至

Agent Lightning v1.0: Towards Harnessed Agentic RL

  • arXiv: 2608.17528
  • 版本: v1
  • 提交日期: 2026-08-18
  • 最后更新: —
  • 作者: Zhiyuan He et al.
  • 主要机构: Microsoft;Fudan University;Zhejiang University;University of Edinburgh
  • 主方向: Harness RSI
  • 辅助标签: harnessed-agentic-rl, rollout-credit, reward-hacking, coding-agent
  • 阅读状态: Review Run 精读

一句话结论

Agent Lightning v1.0 让真实部署 harness 直接参与 RL,并把一次多轮 agent rollout 正确聚合为训练信号,避免传统训练框架忽略 retokenization、样本合并和 rollout-level credit 的问题。

要解决的问题

真实 agent 的工具、上下文和控制循环由 harness 管理,一次任务会触发数量不定的模型调用;传统 RL 训练器却常假设自己掌控完整环境循环。若把每次模型调用当成独立样本,advantage、loss normalization 和 token 对齐可能错位,训练不稳定或学不到有效行为。

先用大白话说

一个 coding agent 修复 issue 时,可能先读文件、搜索符号、改代码、跑测试,再根据失败继续修改。这整段才是一次任务,但训练器只看到很多零散请求。Agent Lightning 负责把它们重新归回同一次 rollout,奖励“整次任务是否成功”,而不是因为某条消息长、调用次数多就被错误放大。

这个问题的特点是 harness 不只是推理包装,而是决定训练数据如何产生;训练时换掉 harness,会形成训练与部署不一致。

一个具体例子

两个代码 rollout 都最终通过测试:A 调用模型 4 次,B 调用 12 次。如果按 request 行平均 loss,B 会因为拆成更多样本而获得不同权重。rollout-level advantage 与 normalization 让两次任务按完整轨迹贡献信号,不被偶然的调用数量主导。

方法拆解

  • 通过 LLM endpoint proxy 连接任意现有 harness,无需把 agent loop 重写进训练框架。
  • API Gateway 记录模型交互,Rollout Controller 运行本地或 Kubernetes agent,Trainer 聚合轨迹并更新 policy。
  • 在 rollout 层计算 advantage 和 loss normalization,处理一条轨迹拆成动态数量训练样本的问题。
  • coding 流程隐藏 .git、禁用相关命令并限制网络,阻止模型直接获取 gold patch 的 reward hacking。

实验与证据

论文提供约 3,500 行实现,并覆盖搜索、通用 instruction following 和 coding 三种场景;coding 数据清洗、训练脚本和防作弊设置公开,证据强度高。

实验结果总结

  • 训练/评测模型:Llama-3.2-3B-Instruct + GRPO;Qwen3-4B-Instruct-2507 + RLOO;Qwen3.5-9B + mini-SWE-agent harness。
  • Benchmark / 数据:HotpotQA、2WikiMultiHopQA、MuSiQue、Bamboogle、TriviaQA、Natural Questions;Instruction Pre-Training;SWE-smith 与 SWE-bench Verified。
  • 对比基线:训练前 policy,以及 sample-level/rollout-level advantage 和 loss normalization 变体。
  • 指标:搜索 exact match、通用任务 validation reward、coding validation reward 与 SWE-bench Verified pass rate。
  • 主要结果:搜索 25.1%→41.7%;通用任务 51.9%→70.2%;Qwen3.5-9B 在 SWE-bench Verified 41.8%→56.4%,仅用约 6K 训练样本。

与 Seed 的关系

它补足 Harness RSI 的训练基础设施层:EvoTrainer/JIT-Agent 负责诊断和改变 harness,而 Agent Lightning 说明如何让真实 harness 产生的多调用轨迹可靠进入 RL,避免 credit 和部署错位。

可迁移启示

训练 Deep Research agent 时,应把完整“检索—阅读—写作—验证”任务视为 rollout 单元;需保存 harness 版本、工具调用和 token 对齐,并把 citation/附件作弊检测放进训练环境。

局限与待核对

  • 主要强结果来自 coding agent,尚未展示长报告或多模态 Deep Research 的端到端训练。
  • Kubernetes 和多 GPU 训练仍有部署成本;“modest compute”需结合硬件明细解读。
  • 框架解决可靠训练,不负责自动提出新的 harness 设计。

相关链接