leo-lilinxiao/codex-autoresearch

Codex Autoresearch Skill — A self-directed iterative system for Codex that continuously cycles through: modify, verify, retain or discard, and repeat indefinitely. Inspired by Karpathy’s autoresearch concept.

codex‑autoresearch – OpenAI Codex용 자율적이고 측정 가능한 실험

무엇인가요 – Git 추적 코드베이스에서 폐루프 "autoresearch" 프로세스를 실행할 수 있는 Codex 스킬. 수치 목표(예: error_count를 0으로 줄이기)를 제시하면, 이 스킬은 다음과 같은 단계를 수행합니다.

  1. 검사 – 리포지토리 확인, 목표, 편집 가능한 파일, 메트릭 명령어, 리그레션 가드 확인.
  2. Codex에 요청 – 단일이고 집중된 변경 사항을 제안.
  3. 커밋 – 변경 사항 커밋, 검증 명령어 실행, 메트릭 읽기.
  4. 보존 또는 되돌리기 – 메트릭이 개선되었고(가드 통과 시) 변경 사항을 보존하거나, 그렇지 않으면 되돌림.
  5. 목표에 도달하거나 하드 스톱 발생 시까지 반복.

모든 상태는 autoresearch-results/ 폴더에 저장(이벤트 로그(JSONL), HTML 리포트, 로그 등)되며, 리포지토리에 스테이징되지 않습니다.


주요 기능

기능 중요성
Git 기반 안전성 – 모든 시도는 커밋; 실패 시 git revert로 되돌림. 재현 가능하고 감사 가능한 기록 보장.
메트릭 기반 루프 – 단일 숫자(또는 숫자 키를 가진 JSON)를 출력하는 명령어는 어떤 것도 목적에 사용 가능. 테스트 실패, 커버리지, 지연 시간, 바이너리 크기, 보안 경고 등에 적용 가능.
포그라운드 및 백그라운드 모드 – 현재 Codex 작업에서 대화식으로 실행하거나, 밤새 계속 실행하는 워커 분리 가능. 빠른 수정이나 장시간 최적화에 유연하게 대응.
명시적 승인 – 첫 번째 편집 전 목표, 범위, 메트릭, 가드, 모드를 표시하고 승인 필요. 뜻하지 않은 변경 방지.
풍부한 리포트 – 불변의 run.json, 추가 전용 events.jsonl, 메트릭 추이를 시각화하는 자체 포함형 report.html. 감사 및 결과 공유 용이.
안전 모델 – 범위 외 편집, 잘못된 메트릭, 타임아웃, 가드 실패 시 명확한 오류와 함께 실행 중단. 자율 실행 신뢰성 확보.

일반적인 사용 사례

  • 불안정한 테스트 수정 – 테스트 스위트 러너에서 error_count = 0 목표.
  • 바이너리 크기 축소du -b가 보고하는 크기를 메트릭으로 사용.
  • 성능 향상 – 벤치마크 스크립트로 측정한 지연 시간을 메트릭으로 사용.
  • 보안 강화 자동화 – 정적 분석 경고 수를 메트릭으로 사용.
  • 단계적 리팩터링 – 단일 숫자로 표현 가능한 측정 가능한 품질.

빠른 설치 및 첫 실행

# 스킬 설치 (최근 Codex 릴리스 필요, 스킬 설치기 지원)
skill-installer install https://github.com/leo-lilinxiao/codex-autoresearch

# Codex에 완전 쓰기 권한이 있는 깨끗한 리포지토리 열기
codex --dangerously-bypass-approvals-and-sandbox

# 실험 시작 (예: error_count → 0)
$codex-autoresearch
# 베이스라인, 목표, 범위, 검증 명령어 등에 대해 프롬프트 표시
# 승인 후 Codex를 포그라운드 또는 백그라운드에서 실행.

수동 설치는 docs/INSTALL.md 참조.


루프 작동 방식 (간단화)

검증 정보 검사 → 단일 변경 제안 → 커밋 및 메트릭 실행 →
   개선되었고 가드 통과 → 커밋 유지
   아니면 → 커밋 되돌리기
events.jsonl에 이벤트 추가 → 목표 도달 시까지 반복

제어 스크립트가 Git 작업과 상태 파일을 관리; Codex가 가설 생성과 코드 편집을 담당.


안전성 및 신뢰성

  • 모든 시도는 실제 Git 커밋이며, 메모리 내 편집이 아님.
  • 개선되지 않거나 가드 실패 시 자동으로 되돌림.
  • 잘못된 메트릭, 명령어 실패, 타임아웃, 리포지토리 드리프트(예: 브랜치 변경) 발생 시 실행 중단.
  • 파일은 스테이징되지 않음; 모든 아티팩트는 autoresearch-results/ 내에 유지.
  • 보존된 메트릭이 확인된 목표를 충족할 때만 실행은 완료로 보고됨.

문서 및 도움말

  • 설치docs/INSTALL.md
  • 사용자 가이드docs/GUIDE.md (설정, 라이프사이클, 문제 해결)
  • 예제docs/EXAMPLES.md (샘플 프롬프트, 메트릭 패턴)
  • 기여CONTRIBUTING.md
  • FAQ – README 내장 (Git 요구사항, 중지/재개, 완전 접근 필요성 등)

라이선스

MIT – LICENSE 참조.


결론: codex‑autoresearch는 Git 기반의 구체적인 자동화 계층으로, OpenAI Codex가 가설 기반 코드 변경을 수치 목표에 도달할 때까지 실행할 수 있게 해주며, 완전한 감사 가능성과 안전 보장이 있습니다. AI 지원 개발의 최전선에 위치한 진정한 소프트웨어 프로젝트입니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트