QoderAI/better-harness
An open-source Harness Engineering platform for coding agents—define harnesses as code, run controlled experiments, inspect evidence, and compare outcomes.
它解決的問題
AI程式碼代理經常比周圍的工作流程更快,導致目標模糊、無法重現的臨時步驟,以及缺乏證據證明變更確實有效。Better Harness 透過分析程式碼差異周圍的工作流程,而非僅僅關注最終輸出,來識別並優先處理 AI 程式碼流程中的缺口,從而解決這些系統層級的問題。
如何運作
Better Harness 使用前饋與反饋迴圈,從五個維度評估「代理工作迴圈」:
- 任務理解:檢查代理是否清楚目標與「完成」的定義,並依據規則、規格與設計文件進行確認。
- 受控執行:確保工作遵循可重複的路徑,透過技能、命令與沙盒邊界來實現。
- 變更驗證:尋找證據(測試、靜態檢查工具、診斷資訊)以確認變更確實有效。
- 可靠交付:驗證品質檢查與人工審查未被跳過。
- 學習捕獲:確保從一次任務中獲得的教訓能透過記憶與可重用技能應用於未來任務。
它可作為多種程式碼代理(如 Claude Code、Cursor、Codex 和 GitHub Copilot)的外掛程式,並產生基於證據的報告(HTML 或 Markdown 格式),突出顯示優先級別的發現,並建議範圍明確的修復計畫。
適用對象
使用 AI 程式碼代理的開發者與團隊,希望超越僅審查差異(diff)的層面,進一步優化整個 AI 協助開發的生命周期。
主要特色
- 多主機支援:相容於多種代理,包括 Claude Code、Cursor、Codex、GitHub Copilot、Qwen Code 等。
- 基於證據的分析:明確追蹤所觀察到的內容與缺失的部分,避免提出無根據的評分或主張。
- 可執行的發現:將缺口轉化為優先級別的發現,包含影響評估、預期輸出與範圍明確的修復計畫。
- 視覺化報告:提供 HTML 報告與「Harness Inspector」工具,用於追蹤交付流程與代理活動。
相關
- 專案
- Dispatch
- 專案
- 專案
- 專案