Agent Lightning v1.0: Towards Harnessed Agentic RL¶
- arXiv: 2608.17528
- 版本: v1
- 提交日期: 2026-08-18
- 最后更新: —
- 作者: Zhiyuan He et al.
- 主要机构: Microsoft;Fudan University;Zhejiang University;University of Edinburgh
- 主方向:
Harness RSI - 辅助标签:
harnessed-agentic-rl,rollout-credit,reward-hacking,coding-agent - 阅读状态: Review Run 精读
一句话结论¶
Agent Lightning v1.0 让真实部署 harness 直接参与 RL,并把一次多轮 agent rollout 正确聚合为训练信号,避免传统训练框架忽略 retokenization、样本合并和 rollout-level credit 的问题。
要解决的问题¶
真实 agent 的工具、上下文和控制循环由 harness 管理,一次任务会触发数量不定的模型调用;传统 RL 训练器却常假设自己掌控完整环境循环。若把每次模型调用当成独立样本,advantage、loss normalization 和 token 对齐可能错位,训练不稳定或学不到有效行为。
先用大白话说¶
一个 coding agent 修复 issue 时,可能先读文件、搜索符号、改代码、跑测试,再根据失败继续修改。这整段才是一次任务,但训练器只看到很多零散请求。Agent Lightning 负责把它们重新归回同一次 rollout,奖励“整次任务是否成功”,而不是因为某条消息长、调用次数多就被错误放大。
这个问题的特点是 harness 不只是推理包装,而是决定训练数据如何产生;训练时换掉 harness,会形成训练与部署不一致。
一个具体例子¶
两个代码 rollout 都最终通过测试:A 调用模型 4 次,B 调用 12 次。如果按 request 行平均 loss,B 会因为拆成更多样本而获得不同权重。rollout-level advantage 与 normalization 让两次任务按完整轨迹贡献信号,不被偶然的调用数量主导。
方法拆解¶
- 通过 LLM endpoint proxy 连接任意现有 harness,无需把 agent loop 重写进训练框架。
- API Gateway 记录模型交互,Rollout Controller 运行本地或 Kubernetes agent,Trainer 聚合轨迹并更新 policy。
- 在 rollout 层计算 advantage 和 loss normalization,处理一条轨迹拆成动态数量训练样本的问题。
- coding 流程隐藏
.git、禁用相关命令并限制网络,阻止模型直接获取 gold patch 的 reward hacking。
实验与证据¶
论文提供约 3,500 行实现,并覆盖搜索、通用 instruction following 和 coding 三种场景;coding 数据清洗、训练脚本和防作弊设置公开,证据强度高。
实验结果总结¶
- 训练/评测模型:Llama-3.2-3B-Instruct + GRPO;Qwen3-4B-Instruct-2507 + RLOO;Qwen3.5-9B + mini-SWE-agent harness。
- Benchmark / 数据:HotpotQA、2WikiMultiHopQA、MuSiQue、Bamboogle、TriviaQA、Natural Questions;Instruction Pre-Training;SWE-smith 与 SWE-bench Verified。
- 对比基线:训练前 policy,以及 sample-level/rollout-level advantage 和 loss normalization 变体。
- 指标:搜索 exact match、通用任务 validation reward、coding validation reward 与 SWE-bench Verified pass rate。
- 主要结果:搜索 25.1%→41.7%;通用任务 51.9%→70.2%;Qwen3.5-9B 在 SWE-bench Verified 41.8%→56.4%,仅用约 6K 训练样本。
与 Seed 的关系¶
它补足 Harness RSI 的训练基础设施层:EvoTrainer/JIT-Agent 负责诊断和改变 harness,而 Agent Lightning 说明如何让真实 harness 产生的多调用轨迹可靠进入 RL,避免 credit 和部署错位。
可迁移启示¶
训练 Deep Research agent 时,应把完整“检索—阅读—写作—验证”任务视为 rollout 单元;需保存 harness 版本、工具调用和 token 对齐,并把 citation/附件作弊检测放进训练环境。
局限与待核对¶
- 主要强结果来自 coding agent,尚未展示长报告或多模态 Deep Research 的端到端训练。
- Kubernetes 和多 GPU 训练仍有部署成本;“modest compute”需结合硬件明细解读。
- 框架解决可靠训练,不负责自动提出新的 harness 设计。
相关链接¶
- Paper HTML: arXiv HTML
- Code: microsoft/agent-lightning
- Dataset / Project: 项目仓库