paladini/harness-score

Your AI coding agent is only as reliable as the harness around it. Measure that harness in seconds with harness-score.

何を解決するか

AIコーディングエージェント(Cursor、Claude Code、Windsurfなど)は、構造化された「ハーネス」——エージェントがミスを犯さないよう制御し、各セッションでプロジェクトの慣習を再発見しないようにするルール、ガイド、ガードレールのセット——が欠けているため、しばしば信頼性が低いです。Harness Scoreは、このインフラの成熟度を決定論的に測定する方法を提供し、『感覚でコーディングする』(vibe-coding)から、定量的で工学的アプローチによるエージェントの信頼性へと進化させます。

動作方法

決定論的なスキャナーであり、LLMやネットワークアクセスを使わず、リポジトリのファイルシステムを分析します。6つの次元(コンテキストとガイド、スキルとコマンド、フックとガードレール、センサーとフィードバック、CIフィードバック、衛生と安全)にわたって36のチェックを実行し、L0(未ハーネス)からL4(自己修正)までの成熟度レベルを割り当てます。欠落しているアーティファクト(例:AGENTS.mdファイル、.cursor/rules/、CIパイプライン)を特定し、次の成熟度レベルに到達するための具体的な修正リストを提供します。

対象ユーザー

AIコーディングエージェントを使用している開発者やチームで、プロジェクトがエージェント対応かつ信頼性があることを保証したい人、またCIパイプラインを最小のエージェントハーネス成熟度に基づいてガートするDevOpsエンジニア。

特徴

  • 決定論的スコアリング:LLM呼び出しもネットワークリクエストもゼロで、異なる環境間で一貫した結果を保証します。
  • 成熟度ラダー:ポイント数ではなく、ハーネスの構造に基づいて進捗を制御する5段階システム(L0–L4)。
  • CI統合:GitHub Actionと--min-levelフラグを提供し、エージェントハーネスの成熟度が低下した場合にビルドを失敗させます。
  • ツール非依存:Cursor、Claude Code、Windsurf、Cline、Continueなど、さまざまなAIコーディングツールと互換性があります。
  • 実行可能な診断:すべての失敗したチェックは、ギャップを修正する具体的な修復手順にリンクしています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト