china-qijizhifeng/agentic-harness-engineering
Official AHE code — Agentic Harness Engineering: observability-driven automatic evolution of coding-agent harnesses (concurrent w/ meta-harness). NexAU-AHE reaches 84.7% ± 2.1 pass@1 on Terminal-Bench 2 (GPT-5.5). Lifts GPT-5.4 69.7→77.0% over 10 iters, beats Codex/ACE/Training-Free GRPO; frozen harness transfers to SWE-bench-Verified.
解决的问题
解决手动优化代码代理(coding agent)‘工具链’(周围基础设施)的困难。与计算成本高昂的基座大模型微调不同,AHE 自动演化系统提示、工具描述、工具实现、中间件、技能、子代理和长期记忆,以提升代理在编码任务中的性能。
工作原理
AHE 基于三个可观测层,采用迭代的 评估 → 分析 → 改进 循环:
- 组件可观测性:使用 NexAU 将工具链分解为七个 Git 可追踪、可审计的组件。
- 经验可观测性:代理调试器将海量原始执行轨迹提炼为带来源的报告,识别失败的根本原因。
- 决策可观测性:演化代理提出基于证据的工具链修改建议,预测其影响,并利用后续评估结果来验证或证伪这些预测。
每次发布都在隔离的 E2B沙箱中运行,以确保安全性和可复现性。
适用人群
希望在不重新训练底层基座模型的前提下,系统性提升代码代理性能的 AI 工程师和研究人员。
核心亮点
- 固定基座模型:优化环境和工具,而非模型权重。
- 证据驱动:每次变更必须基于失败证据和预测影响。
- 跨模型迁移:演化后的工具链可迁移至不同基座模型,无需重新演化。
- 高性能表现:在 Terminal-Bench 2.0 上实现显著的通过率提升。
相关
- 项目
- 项目
- Dispatch
- 项目
- 项目