QoderAI/better-harness
An open-source Harness Engineering platform for coding agents—define harnesses as code, run controlled experiments, inspect evidence, and compare outcomes.
해결하는 문제
AI 코드 에이전트는 주변 워크플로우보다 빠르게 움직일 수 있어, '모호한 목표', 재현 불가능한 즉흥적인 단계, 그리고 변경 사항이 실제로 작동하는지에 대한 증거 부족이라는 문제를 야기합니다. Better Harness는 코드 변경 사항 주변 워크플로우를 분석함으로써, 단순히 최종 출력만이 아니라 시스템 수준의 문제를 식별하고 우선순위를 정하는 방식으로 AI 코드 개발 과정의 격차를 해결합니다.
작동 방식
Better Harness는 다섯 가지 차원에서 "에이전트 워크 루프"를 평가하기 위해 피드포워드-피드백 루프를 사용합니다:
- 작업 이해: 규칙, 사양 문서, 설계 문서를 활용해 에이전트가 목표와 "완료"의 정의를 알고 있는지 확인합니다.
- 통제된 실행: 스킬, 명령어, 사전(샌드박스) 경계를 통해 반복 가능한 경로를 따르도록 보장합니다.
- 변경 사항 검증: 변경 사항이 작동하는지 여부를 확인할 수 있는 증거(테스트, 린터, 진단 도구 등)를 찾습니다.
- 신뢰할 수 있는 배포: 품질 검사 및 인간 검토가 우회되지 않았는지 확인합니다.
- 학습 캡처: 메모리와 재사용 가능한 스킬을 통해 한 작업에서 얻은 교훈이 미래 작업에 기여하도록 보장합니다.
이 도구는 Claude Code, Cursor, Codex, GitHub Copilot 등 다양한 코드 에이전트의 플러그인으로 통합되며, 증거 기반 보고서(HTML 또는 Markdown 형식)를 생성하여 우선순위가 지정된 발견 사항을 강조하고 범위가 제한된 수정 계획을 제안합니다.
대상 사용자
AI 코드 에이전트를 사용하면서 단순히 코드 차이(diff)를 검토하는 것을 넘어, 전체 AI 지원 개발 라이프사이클을 최적화하고자 하는 개발자 및 팀입니다.
주요 기능
- 다중 호스트 지원: Claude Code, Cursor, Codex, GitHub Copilot, Qwen Code 등 다양한 에이전트와 호환됩니다.
- 증거 기반 분석: 관찰된 내용과 누락된 내용을 명시적으로 추적하여 근거 없는 점수나 주장 방지.
- 실천 가능한 발견: 격차를 우선순위가 지정된 발견으로 전환하고, 영향 평가, 예상 출력, 범위가 제한된 수정 계획을 제공.
- 시각적 보고서: HTML 보고서와 "Harness Inspector"를 제공하여 배포 및 에이전트 활동 추적 가능.
관련
- 프로젝트
- Dispatch
- 프로젝트
- 프로젝트
- 프로젝트