paladini/harness-score

Your AI coding agent is only as reliable as the harness around it. Measure that harness in seconds with harness-score.

해결하는 문제

Cursor, Claude Code, Windsurf와 같은 AI 코드 에이전트는 일반적으로 구조화된 '하네스'(규칙, 가이드, 가드레일의 집합)가 부족하여 신뢰할 수 없으며, 각 세션마다 프로젝트 규칙을 다시 발견하거나 실수를 범할 수 있습니다. Harness Score는 이 인프라의 성숙도를 결정론적으로 측정하는 방법을 제공하여, '감각 기반 코딩'(vibe-coding)에서 벗어나 정량적이고 공학 기반의 에이전트 신뢰성 접근법으로 전환합니다.

작동 방식

LLM이나 네트워크 접근 없이 리포지토리의 파일 시스템을 분석하는 결정론적 스캐너입니다. 컨텍스트 및 가이드, 스킬 및 명령, 후크 및 가드레일, 센서 및 피드백, CI 피드백, 위생 및 안전의 6가지 차원에서 총 36개의 체크를 수행하여 L0(미하네스)에서 L4(자기 수정)까지의 성숙도 수준을 부여합니다. 누락된 아티팩트(예: AGENTS.md, .cursor/rules/, CI 파이프라인)를 식별하고, 다음 성숙도 수준에 도달하기 위한 구체적인 수정 목록을 제공합니다.

대상 사용자

AI 코드 에이전트를 사용하는 개발자 및 팀으로, 프로젝트가 에이전트 대응 가능하고 신뢰할 수 있도록 보장하고자 하는 사람, 또는 CI 파이프라인을 최소한의 에이전트 하네스 성숙도 수준 기반으로 가드하고자 하는 DevOps 엔지니어.

주요 특징

  • 결정론적 스코어링: LLM 호출도, 네트워크 요청도 없어 다양한 환경에서 일관된 결과를 보장합니다.
  • 성숙도 래더: 총 점수보다 하네스의 구조에 기반해 진전을 제어하는 5단계 시스템(L0–L4).
  • CI 통합: GitHub Action과 --min-level 플래그를 포함하여 에이전트 하네스 성숙도가 저하되면 빌드를 실패시킵니다.
  • 도구 독립성: Cursor, Claude Code, Windsurf, Cline, Continue 등 다양한 AI 코드 도구와 호환됩니다.
  • 실행 가능한 진단: 모든 실패한 체크는 구체적인 복구 조치를 링크하여 갭을 보완할 수 있도록 합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트