跳转至

JIT-Agent: Scaling Harness Intelligence via Just-in-Time Harness Evolution

  • arXiv: 2608.25593
  • 版本: v1
  • 提交日期: 2026-08-26
  • 最后更新: —
  • 作者: Guibin Zhang et al.
  • 主要机构: LV-NUS Lab(完整机构待核对)
  • 主方向: Harness RSI
  • 辅助标签: harness-generation, harness-repair, test-time-evolution, experience-bank
  • 阅读状态: Review Run 精读

一句话结论

JIT-Agent 把 memory、planning、action 和 tool/skill orchestration 写成可生成代码,让模型针对当前任务即时构造 harness,并从执行反馈和历史 harness 库中持续修复、演进。

要解决的问题

同一个底座模型换一套 harness,表现可能差很多;但现有 harness 多由人手写,常常针对某个任务或模型,无法随着任务结构、失败模式和模型能力变化自动调整。

先用大白话说

底座模型像发动机,harness 像变速箱、导航和控制系统。传统做法给所有道路装同一套控制系统;JIT-Agent 先看这次是深度检索、旅行规划还是办公操作,再现场生成更合适的 memory、plan 和工具协议。运行失败时,它根据反馈修补这套代码;验证有收益后,才把经验放进 harness bank 供未来任务检索。

这个问题的特点是 harness 本身成为可优化对象,而且改动必须可执行、可测量,不能只生成一段听起来合理的提示词。

一个具体例子

旅行规划要求同时满足日期、预算、地点和交通约束。通用 agent 容易在长轨迹中漏掉条件。JIT-Agent 可生成一个显式保存硬约束、逐项验证候选并在提交前复查的 harness;若运行发现某项约束仍丢失,再基于执行反馈做最多数轮小修复。

方法拆解

  • 用统一 HarnessFactory 把 harness 划分为 memory、planning、action、capability 四个模块,生成结果是结构化可执行代码。
  • Stage I 学习按任务定制 harness;Stage II 从编译/运行失败轨迹学习小步修复。
  • Stage III 使用 Evo-GDPO 学习提出能超过历史设计的新 harness。
  • streaming inference 将验证后的 reward、latency、cost 写入 harness bank;没有合格改进时不更新。

实验与证据

论文覆盖九个 benchmark、两个主要 executor backbone、五种成熟 harness 对照,以及成本/延迟和跨模型迁移,证据强度高。项目公开代码、模型和 harness 数据。

实验结果总结

  • 训练/评测模型:JIT-Agent 基于 Qwen3.6-27B;主要挂载 GLM-5.2、DeepSeek-V4-Flash-Preview,并在 Qwen3.6、Mimo-V2.5 上测迁移。
  • Benchmark / 数据:BrowseComp-Plus、DeepSearchQA、xBench-DeepSearch、AgentIF-Oneday、PinchBench、DeepPlanning-Shopping/Travel、OfficeBench、OdysseyBench。
  • 对比基线:vanilla GLM/DeepSeek/Qwen/Kimi/GPT/Gemini;固定 backbone 下对比 Claude Code、Codex、OpenCode、Hermes、NanoBot。
  • 指标:统一 0–100 的 accuracy、answer F1、rubric score、任务成功率,以及成本和延迟。
  • 主要结果:18 个直接配对全部提升;GLM-5.2 九项平均 74.1→81.8(+7.7),DeepSeek-V4-Flash 66.7→75.5(+8.8);最大单项提升 24.8 points。

与 Seed 的关系

它与 EvoTrainer、Recuris、EvoHarness-RL 直接同轨:EvoTrainer 强调训练侧诊断,Recuris 强调 memory/skill 更新,JIT-Agent 进一步把整套 harness 的即时生成、修复、验证保留做成统一模型。

可迁移启示

Deep Research harness 可以按任务即时决定证据 memory schema、检索规划、工具协议和写作检查;经验库只保存经过 reward、成本、延迟共同门控的版本,避免失败配置污染后续任务。

局限与待核对

  • 底座与 benchmark 很新,复现实验依赖较多模型服务和运行环境。
  • streaming evolution 的长期污染、回滚和跨任务负迁移仍需更长周期验证。
  • arXiv HTML 只显示 LV-NUS Lab,完整机构待核对。

相关链接