neosigmaai/auto-harness
Bring your own agent and build a self-improving agentic system. Automatically mine failures, optimize the agent harness, and gate against regressions.
해결하는 문제
auto-harness는 AI 코딩 에이전트의 자동화된 자기 개선을 위한 프레임워크입니다. 특정 벤치마크에서 에이전트의 성능을 향상시키기 위해 시스템 프롬프트와 도구 정의를 수동으로 반복 수정해야 하는 문제를 해결합니다. 개발자가 직접 반복하는 대신, 코딩 에이전트가 다른 에이전트의 코드와 프롬프트를 최적화하여 자기 개선 루프를 생성합니다.
작동 방식
이 시스템은 폐쇄 루프 최적화 프로세스로 작동합니다:
- 실행: 시스템이 벤치마크(예: Tau-bench, Terminal-Bench 2.0 또는 BIRD-Interact)를 실행하고 결과를 기록합니다.
- 분석: 코딩 에이전트가 학습 세트의 실패 추적을 분석하여 에이전트가 실패한 원인을 진단합니다.
- 개선: 코딩 에이전트가 대상 에이전트의 파일(
agent/agent.py)을 수정하여 시스템 프롬프트나 도구를 개선합니다. - 게이팅: 모든 변경 사항은 3단계 게이트를 통과합니다. 이전에 통과한 작업의 회귀 테스트 스위트, 평균 보상이 향상되었는지 확인하는 전체 테스트 세트 평가, 그리고 새로운 통과 작업을 회귀 스위트에 추가하는 스위트 승격 단계입니다.
- 기록: 결과는 기록 로그에 추가되며, 에이전트는 발견한 내용을
learnings.md파일에 기록합니다. - 반복: 이 프로세스가 반복되어 에이전트가 밤새도록 반복 학습을 수행할 수 있습니다.
대상 사용자
LLM 기반 에이전트의 자기 개선 루프를 자동화하려는 개발자 및 AI 연구원, 특히 도구 사용, SQL 생성 또는 터미널 기반 작업에 중점을 둔 분들에게 적합합니다.
주요 특징
- 벤치마크 독립적: 작업별 보상을 제공하는 모든 벤치마크와 함께 작동합니다.
- 자기 관리형 평가: 코딩 에이전트가 수동 큐레이션 없이
suite.json회귀 스위트를 자동으로 관리합니다. - 구조적 부정 방지: 코딩 에이전트가 테스트 추적이 아닌 학습 추적에만 접근할 수 있도록 하여 데이터 유출을 방지합니다.
- 통합 벤치마크: Tau-bench, Terminal-Bench 2.0 및 BIRD-Interact에 대한 기본 지원을 제공합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트