437 字
2 分钟
Agentic Harness Engineering:根据运行记录改进 Coding Agent
AHE 根据运行记录自动改进 coding agent 的 harness,即提示、工具、记忆等配套组件。实验保持底座模型不变,只迭代这些组件。
论文信息
- 官方链接:https://arxiv.org/abs/2604.25850v3 (PDF: https://arxiv.org/pdf/2604.25850v3)
- 代码仓库:https://github.com/china-qijizhifeng/agentic-harness-engineering(MIT)
- 作者:Jiahang Lin 等(Fudan University / Peking University / 上海齐吉智峰)
- 版本:v3,2026-04-30
一句话摘要
AHE 将 harness 拆成可追踪的文件组件,从运行轨迹中提取改进线索,再通过评测验证修改。在 Terminal-Bench 2 上迭代十轮后,pass@1 从 69.7% 提升到 77.0%。
方法
- 组件可观测性:把系统提示、工具、middleware、memory、skill、sub-agent 等拆成文件化组件(NexAU 风格),支持最小改动、可回滚、可差分验证。
- 经验可观测性:通过 Agent Debugger 从交互轨迹中提取分层证据,支持从摘要追溯到具体记录,为下一轮改进提供依据。
- 决策可观测性:每次编辑都附带可验证预测,下一轮任务评测验证其有效性,只有达成预期提升的改动被保留。
关键实验结论
- 主任务:Terminal-Bench 2 pass@1 从 69.7% → 77.0%(10 轮迭代),超过 Codex-CLI(71.9%)、ACE 与 TF-GRPO。
- 迁移性:冻结最终 harness 在 SWE-bench-verified 上也保持优势,并减少约 12% token;对 3 类其他模型有 +5.1 到 +10.1 的提升(pp)。
- 消融分析:性能收益主要来自 tool/middleware/long-term memory 等结构化组件,而非单纯 system prompt 文案改写。
局限与讨论
- 实验主要围绕 Terminal-Bench 2 与 SWE-bench-verified,未覆盖更广泛实际工程场景;
- 迭代步骤与预算依赖研究设定,跨模型/跨预算的泛化需进一步验证;
- 自动改写带来的长期治理、审查与安全边界仍需更强机制约束。
Agentic Harness Engineering:根据运行记录改进 Coding Agent
https://blog.lpkt.cn/posts/papers/agentic-harness-engineering/