china-qijizhifeng/agentic-harness-engineering
Official AHE code — Agentic Harness Engineering: observability-driven automatic evolution of coding-agent harnesses (concurrent w/ meta-harness). NexAU-AHE reaches 84.7% ± 2.1 pass@1 on Terminal-Bench 2 (GPT-5.5). Lifts GPT-5.4 69.7→77.0% over 10 iters, beats Codex/ACE/Training-Free GRPO; frozen harness transfers to SWE-bench-Verified.
解決的問題
解決手動優化程式代理(coding agent)「工具鏈」(周邊基礎設施)的困難。與計算成本高昂的基礎大模型微調不同,AHE 自動演化系統提示、工具描述、工具實作、中介層、技能、子代理與長期記憶,以提升代理在程式任務中的表現。
工作原理
AHE 基於三個可觀測層,採用迭代的 評估 → 分析 → 改進 循環:
- 組件可觀測性:使用 NexAU 將工具鏈分解為七個 Git 可追蹤、可審計的組件。
- 經驗可觀測性:代理除錯器將龐大的原始執行軌跡精煉為帶來源的報告,識別失敗的根本原因。
- 決策可觀測性:演化代理提出基於證據的工具鏈修改建議,預測其影響,並利用後續評估結果來驗證或否證這些預測。
每次發佈都在隔離的 E2B 沙箱中執行,以確保安全性與可重現性。
適用對象
希望在不重新訓練底層基礎模型的前提下,系統性提升程式代理效能的 AI 工程師與研究人員。
核心亮點
- 固定基礎模型:優化環境與工具,而非模型權重。
- 證據驅動:每次變更必須基於失敗證據與預測影響。
- 跨模型遷移:演化後的工具鏈可遷移至不同基礎模型,無需重新演化。
- 高表現效能:在 Terminal-Bench 2.0 上實現顯著的通過率提升。
相關
- 專案
- 專案
- Dispatch
- 專案
- 專案