paladini/harness-score

Your AI coding agent is only as reliable as the harness around it. Measure that harness in seconds with harness-score.

解決的問題

AI 編碼代理(如 Cursor、Claude Code 或 Windsurf)經常不可靠,是因為缺乏結構化的「Harness」——即防止它們犯錯或每次會話都重新發現專案規範的規則、指南與防護措施。Harness Score 提供了一種決定性的方式來衡量此基礎設施的成熟度,從「感覺編碼」(vibe-coding)轉向可量化的、工程導向的代理可靠性方法。

作用方式

這是一個決定性掃描器,不使用 LLM 或網路存取,直接分析倉儲的檔案系統。它在六個維度(上下文與指南、技能與指令、鉤子與防護措施、感測器與回饋、CI 回饋、衛生與安全)執行 36 項檢查,將成熟度從 L0(未受控)到 L4(自我修正)進行分級。該工具會識別遺漏的資產——如 AGENTS.md 檔案、.cursor/rules/ 目錄或 CI 流水線——並提供一份依優先順序排序的具體修復建議,以達到下一個成熟度層級。

適用對象

希望確保專案具備代理就緒性與可靠性的開發者與團隊,以及希望根據最低代理哈尼斯成熟度層級來控制 CI 流水線的 DevOps 工程師。

主要亮點

  • 決定性評分:零 LLM 呼叫與零網路請求,確保在不同環境中結果一致。
  • 成熟度階梯:5 級系統(L0–L4),根據哈尼斯的結構而非總分來控制進展。
  • CI 整合:包含 GitHub Action 與 --min-level 標誌,若代理哈尼斯成熟度下降則使建置失敗。
  • 工具無關性:適用於多種 AI 編碼工具,包括 Cursor、Claude Code、Windsurf、Cline 與 Continue。
  • 可操作診斷:每個失敗的檢查都連結到具體的修復方案,協助填補缺口。

相關

  • 專案
  • 專案
  • 專案
  • 專案