china-qijizhifeng/agentic-harness-engineering

Official AHE code — Agentic Harness Engineering: observability-driven automatic evolution of coding-agent harnesses (concurrent w/ meta-harness). NexAU-AHE reaches 84.7% ± 2.1 pass@1 on Terminal-Bench 2 (GPT-5.5). Lifts GPT-5.4 69.7→77.0% over 10 iters, beats Codex/ACE/Training-Free GRPO; frozen harness transfers to SWE-bench-Verified.

解决的问题

解决手动优化代码代理(coding agent)‘工具链’(周围基础设施)的困难。与计算成本高昂的基座大模型微调不同,AHE 自动演化系统提示、工具描述、工具实现、中间件、技能、子代理和长期记忆,以提升代理在编码任务中的性能。

工作原理

AHE 基于三个可观测层,采用迭代的 评估 → 分析 → 改进 循环:

  1. 组件可观测性:使用 NexAU 将工具链分解为七个 Git 可追踪、可审计的组件。
  2. 经验可观测性:代理调试器将海量原始执行轨迹提炼为带来源的报告,识别失败的根本原因。
  3. 决策可观测性:演化代理提出基于证据的工具链修改建议,预测其影响,并利用后续评估结果来验证或证伪这些预测。

每次发布都在隔离的 E2B沙箱中运行,以确保安全性和可复现性。

适用人群

希望在不重新训练底层基座模型的前提下,系统性提升代码代理性能的 AI 工程师和研究人员。

核心亮点

  • 固定基座模型:优化环境和工具,而非模型权重。
  • 证据驱动:每次变更必须基于失败证据和预测影响。
  • 跨模型迁移:演化后的工具链可迁移至不同基座模型,无需重新演化。
  • 高性能表现:在 Terminal-Bench 2.0 上实现显著的通过率提升。

相关

  • 项目
  • 项目
  • Dispatch
  • 项目
  • 项目