china-qijizhifeng/agentic-harness-engineering
Official AHE code — Agentic Harness Engineering: observability-driven automatic evolution of coding-agent harnesses (concurrent w/ meta-harness). NexAU-AHE reaches 84.7% ± 2.1 pass@1 on Terminal-Bench 2 (GPT-5.5). Lifts GPT-5.4 69.7→77.0% over 10 iters, beats Codex/ACE/Training-Free GRPO; frozen harness transfers to SWE-bench-Verified.
해결하는 문제
코딩 에이전트의 '하네스'(주변 인프라)를 수동으로 최적화하는 어려움을 해결합니다. 계산 비용이 큰 기초 LLM의 파인튜닝 대신, AHE는 시스템 프롬프트, 도구 설명, 도구 구현, 미들웨어, 기술, 서브에이전트, 장기 기억을 자동으로 진화시켜 코딩 작업에서의 에이전트 성능을 향상시킵니다.
작동 방식
AHE는 세 가지 관측 레이어를 기반으로 반복적인 평가 → 분석 → 개선 루프를 사용합니다:
- 컴포넌트 관측: NexAU를 사용해 하네스를 7개의 Git 추적 가능하고 감사 가능한 컴포넌트로 분해합니다.
- 경험 관측: 에이전트 디버거가 방대한 원시 실행 트레이스를 소스 기반 보고서로 요약하여 실패의 근본 원인을 식별합니다.
- 의사결정 관측: 에볼브 에이전트는 증거 기반 수정을 제안하고 영향을 예측하며, 이후 평가 결과를 통해 예측을 반증하거나 확인합니다.
모든 배포는 안전성과 재현성을 보장하기 위해 고립된 E2B 사전에서 실행됩니다.
대상 사용자
기초 모델을 재학습하지 않고도 에이전트 성능을 체계적으로 향상시키고자 하는 AI 엔지니어 및 연구자
주요 특징
- 고정된 기초 모델: 모델 가중치가 아닌 환경과 도구를 최적화합니다.
- 증거 기반: 모든 변경은 실패 증거와 예측된 영향에 기반해야 합니다.
- 모델 간 이식성: 진화된 하네스는 다른 기초 모델로 이식 가능하며, 재진화가 필요 없습니다.
- 고성능: Terminal-Bench 2.0에서 뚜렷한 성공률 향상을 입증했습니다.
관련
- 프로젝트
- 프로젝트
- Dispatch
- 프로젝트
- 프로젝트