jinzijian/EvoTrace

Compile real-world Claude Code and Codex trajectories into verified, tradable post-training assets.

EvoTrace – 당신의 Claude Code / Codex 세션을 재현 가능한 AI 학습 자산으로 전환

무엇인가요 – EvoTrace는 로컬 우선 도구로, 이미 당신의 머신에 존재하는 코드 어시스턴트 기록(Claude Code 또는 Codex)을 읽어내고, 유용한 "에피소드"를 추출하여 모델 학습, 평가, 강화학습 파이프라인에 사용할 수 있는 구조화된 자산으로 변환합니다. 이 도구는 당신의 코드 에이전트를 대체하지 않으며, 에이전트가 이미 수행한 내용을 증거 기반의 작업, 검증기, Docker 호환 환경으로 컴파일할 뿐입니다.


핵심 아이디어

  1. 가져오기 – 기존의 Claude Code 또는 Codex 세션 로그를 가져옵니다.
  2. 마이닝 – 로그에서 충분한 신호(의도, 행동, 실패, 수정)를 포함한 의미적으로 일관된 코드 에피소드를 탐색합니다.
  3. 검토 – 결정론적 4에이전트 파이프라인으로 각 에피소드를 검토하여 다음 중 하나로 결정합니다:
    • 선호도/복구 데이터 (DPO, SFT, QA용)
    • 실행 가능한 작업 번들 (리포지토리 스냅샷 + 사양)
    • 검증기 + 보상 후보
    • 명확한 이유와 함께 거부
  4. 검증 – 격리된 Docker 컨테이너에서 생성된 작업을 검증하여 기본 상태는 거부되고 참조 상태는 수락됨을 확인합니다.
  5. 선택적 강화, 캘리브레이션, "진화" 단계를 통해 작업의 난이도를 높이거나 보류된 작업으로의 전이를 테스트할 수 있습니다.

얻을 수 있는 결과

자산 생성물 일반적인 후속 사용
후보 카탈로그 의도, 리포지토리, 수정, 출처 갭을 포함한 에피소드의 순위 목록 대량의 채팅 덤프에서 고가치 기록을 신속히 식별
선호도/복구 데이터 선택된 시도 vs. 거부된 시도, 인간의 수정, 성공적인 복구 DPO, 지도 미세조정, 실패 복구 학습
실행 가능한 작업 번들 리포지토리 스냅샷, 초기 상태, 종속성 목록, 작업 사양 코드 에이전트 벤치마크, 회귀 테스트 세트, RL 환경
검증기 및 보상 후보 테스트 명령어, 행동 검사, 정책, 출처 점수 롤아웃, RL 보상 신호 생성
난이도 증거 새로운 솔버 시도 및 검증 결과 커리큘럼 구성, 난이도 인식 샘플링
실행 경험 탐색 트래잭터리에서 얻은 압축된 런타임 사실 경험 전이 실험을 위한 학습 예제

작동 방식 (고수준 파이프라인)

Claude/Codex 기록 → /init (가져오기 + Git 고고학) → /candidates (순위 매기기) →
/review (4에이전트 검토: 마이너 → 게이트 → 빌더/하드너 → 검증기) →
[옵션] /build → /validate (Docker 이중 상태 실행) → 검증된 자산

4에이전트는 최소 권한 역할을 순차적으로 수행하므로, 단일 구성 요소가 자산을 생성하고 승인하는 일을 동시에 수행할 수 없습니다. 검증은 호스트 마운트나 특권 접근 없이 실행되는 일시적인 Docker 컨테이너에서 이루어져 소스 코드가 안전하게 보호됩니다.


시작하기 (빠른 단계)

  1. 설치 – macOS, Linux, WSL에서 작동하는 원라인 스크립트. Windows는 PowerShell 버전 있음.
  2. 실행evotrace를 실행하면 DeepSeek Harness 웹 UI가 시작됩니다.
  3. 설정 – 설정에서 프로바이더(DeepSeek, OpenAI, Anthropic)를 선택. 마이닝과 가져오기는 모델 필요 없음.
  4. 첫 번째 자산 생성 – UI에서 슬래시 명령어 입력:
    /init
    /candidates
    /show 1
    /review 1
    /assets
    
    검토 단계에서는 검증된 작업이 생성되거나 명확한 거부 사유가 제공됩니다.

유용한 경우

  • DPO 또는 인간 피드백 기반 강화학습 데이터셋을 위해 실제 세계의 코드 어시스턴트 상호작용을 수집하고자 하는 연구소.
  • "이 버그를 수정하라"와 같은 정확한 리포지토리 상태를 포함하는 재현 가능한 코드 작업 벤치마크가 필요한 도구 개발자.
  • 원시 로그를 클라우드 모델에 전송하지 않고도 고품질 코드 세션을 개인 아카이브로 보관하고자 하는 개발자.
  • 독립적인 솔버 시도로 측정된 난이도 기반 작업이 필요한 커리큘럼 설계자.

제한 사항 및 현재 상태

  • 알파/프리뷰 – 개발자 프리뷰 버전의 DeepSeek Harness 기반; 많은 기능은 여전히 실험적.
  • Docker만 검증 – 실행 가능한 번들을 생성하거나 검증하려면 Docker 설치 필요.
  • 지원 언어/환경 – 현재 DeepSeek Harness가 재구성할 수 있는 언어와 종속성 설정에 집중; 다국어 또는 복잡한 시스템 수준 빌드는 향후 로드맵.
  • 마켓플레이스 및 미세조정 내보내기 – 향후 제품 계획; 오픈소스 릴리스는 로컬 자산 생성만 제공.

소스에서 설치 (개발자용)

git clone https://github.com/jinzijian/EvoTrace.git
cd EvoTrace
python3 -m venv .venv
source .venv/bin/activate
pip install -e .
pnpm install   # Node 22.19+ 또는 24+
pnpm dev       # 로컬에서 Harness UI 실행

Python CLI (et --help)는 스크립팅용 동일한 결정론적 컴파일 기능을 제공합니다.


라이선스

Apache-2.0 – 상업 및 학술 용도 모두 무료.


결론 – EvoTrace는 원시 코드 어시스턴트 채팅 로그와 현대 AI 기반 코드 생성 연구에 필요한 구조적이고 재현 가능한 자산 사이의 격차를 메우는 전문적인 파이프라인입니다. 모든 작업은 로컬에서 수행되며, 데이터는 사용자의 완전한 통제 하에 있으며, 원시 세션에서 검증된 Docker 작업까지의 명확한 감사 추적을 제공합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트