neosigmaai/auto-harness
Bring your own agent and build a self-improving agentic system. Automatically mine failures, optimize the agent harness, and gate against regressions.
解決的問題
auto-harness 是一個用於 AI 編碼代理自動自我改進的框架。它解決了手動迭代系統提示詞與工具定義以提升代理在特定基準測試中表現的問題。與其由人類開發者進行迭代,該框架指派一個編碼代理來優化另一個代理的程式碼與提示詞,從而建立一個自我改進的循環。
運作方式
該系統以閉環優化流程運作:
- 執行:系統執行基準測試(例如 Tau-bench、Terminal-Bench 2.0 或 BIRD-Interact)並記錄結果。
- 分析:編碼代理分析訓練集中的失敗追蹤紀錄,以診斷代理失敗的原因。
- 改進:編碼代理編輯目標代理的檔案(
agent/agent.py)以改進其系統提示詞或工具。 - 門控:每次變更都會通過三個步驟的門控:包含先前通過任務的迴歸測試套件、確保平均獎勵提升的全測試集評估,以及將新通過任務加入迴歸套件的套件推廣步驟。
- 記錄:結果會附加到歷史日誌中,代理會將其發現記錄在
learnings.md檔案中。 - 重複:流程重複進行,允許代理在夜間進行迭代。
適用對象
希望自動化基於 LLM 的代理之自我改進循環的開發者與 AI 研究人員,特別是專注於工具使用、SQL 生成或終端機任務的領域。
特色亮點
- 基準測試無關:適用於任何提供單一任務獎勵的基準測試。
- 自我維護評估:編碼代理自動管理
suite.json迴歸套件,無需手動維護。 - 結構性防作弊:確保編碼代理僅能存取訓練追蹤紀錄而非測試追蹤紀錄,防止資料洩漏。
- 整合基準測試:內建支援 Tau-bench、Terminal-Bench 2.0 與 BIRD-Interact。
相關
- 專案
- 專案
- 專案
- 專案