paladini/harness-score

Your AI coding agent is only as reliable as the harness around it. Measure that harness in seconds with harness-score.

解决的问题

AI 编码代理(如 Cursor、Claude Code 或 Windsurf)往往不可靠,因为它们缺乏结构化的「Harness」——即防止它们犯错或每次会话都重新发现项目规范的规则、指南和护栏。Harness Score 提供了一种确定性的方法来衡量这种基础设施的成熟度,从「感觉编码」(vibe-coding)转向可量化的、基于工程的方法来提升代理的可靠性。

工作原理

这是一个确定性扫描器,不使用 LLM 或网络访问,直接分析仓库的文件系统。它在六个维度(上下文与指南、技能与命令、钩子与护栏、传感器与反馈、CI 反馈、卫生与安全)上执行 36 项检查,将成熟度从 L0(未受控)到 L4(自我修正)进行分级。该工具会识别缺失的资产——如 AGENTS.md 文件、.cursor/rules/ 目录或 CI 流水线——并提供一份按优先级排序的具体修复建议,以达到下一个成熟度级别。

适用人群

希望确保项目具备代理就绪性和可靠性的开发者和团队,以及希望基于最低代理哈尼斯成熟度级别来控制 CI 流水线的 DevOps 工程师。

主要亮点

  • 确定性评分:零 LLM 调用和零网络请求,确保在不同环境中结果一致。
  • 成熟度阶梯:5 级系统(L0–L4),根据哈尼斯的结构而非总分来控制进展。
  • CI 集成:包含 GitHub Action 和 --min-level 标志,若代理哈尼斯成熟度下降则使构建失败。
  • 工具无关性:适用于多种 AI 编码工具,包括 Cursor、Claude Code、Windsurf、Cline 和 Continue。
  • 可操作诊断:每个失败的检查都链接到具体的修复方案,帮助填补差距。

相关

  • 项目
  • 项目
  • 项目
  • 项目