lllllllama/RigorPilot-Skills
README-first research reproduction skills with bounded execution, auditable evidence, and byte-preserving README annotations.
RigorPilot Skills – 검증 가능한 증거로 AI 연구 README 재현하기
무엇인가요 – RigorPilot Skills는 AI 어시스턴트(또는 skills CLI를 사용하는 사용자)가 연구 리포지토리의 README에 기록된 명령어를 자동으로 실행하고, 정확한 출력을 캡처한 후, README에 간결한 증거 카드를 삽입할 수 있는 에이전트 호환 '스킬' 모음입니다. 원본 파일은 그대로 유지되며, 도구는 각 섹션에서 명령어가 성공했는지, 차단되었는지, 또는 수동 승인이 필요한지 표시하는 병렬 주석 버전(RIGORPILOT_README.md)을 생성합니다.
왜 중요한가요 – 논문의 결과를 재현하는 것은 전례 없이 취약합니다. RigorPilot은 프로세스 (명령어, 로그, 리소스 사용량, 모든 편차)를 기록하고 구조화된 번들(repro_outputs/)에 저장합니다. 이로 인해 논문의 주장이 실제로 실행된 내용과 일치하는지 감사할 수 있으며, 원본 문서를 다시 작성하지 않고도 검증이 가능합니다.
빠른 시작 (설치 및 실행)
# Node.js/npm 필요 (CLI는 작은 npm 패키지)
# 모든 스킬 설치 (재현, 분석, 안전한 디버깅 등 포함)
npx skills add lllllllama/rigorpilot-skills --all
# 또는 핵심 재현 스킬만 설치
npx skills add lllllllama/rigorpilot-skills --skill ai-research-reproduction
- 스킬 프로토콜을 이해하는 에이전트(예: LangChain 기반 어시스턴트)에서 타겟 리포지토리 열기.
- 에이전트에게
ai-research-reproduction스킬을 실행하도록 요청하고, 리포지토리의 README를 지정. - 스킬은 최소한의 문서화된 평가를 실행하고, 모든 로그를
repro_outputs/에 기록하며, 원본 파일 옆에 주석이 달린 README를 생성합니다.
핵심 기능 ("스킬" 인덱스)
| 목적 | 스킬 이름 | 기능 |
|---|---|---|
| 논문 실험을 README에서 재현 | ai-research-reproduction |
명령어를 분석하고 제한된 환경에서 실행하며, 로그를 기록하고 섹션별 증거 카드를 삽입합니다. |
| 순수한 리포지토리 검사 (실행 없음) | analyze-project |
메타데이터, 종속성 목록, 정적 코드 메트릭을 수집합니다. |
| 데이터, 가중치, 환경 부트스트랩 | env-and-assets-bootstrap |
통제된 방식으로 필요한 데이터셋 또는 모델 체크포인트를 다운로드합니다. |
| 하나의 문서화된 추론/평가 실행 | minimal-run-and-audit |
명령어를 실행하고 stdout/stderr를 캡처하며, 최소한의 증거 카드를 생성합니다. |
| 보수적인 학습 실행 | run-train |
짧고 리소스 제한된 학습 루프를 시작하고 손실 곡선을 기록합니다. |
| 코드 변경 전 안전한 디버깅 | safe-debug |
정적 분석과 사전 환경에서의 테스트를 실행하며, 차단 요소를 탐지합니다. |
| 조율된 탐색적 실험 | ai-research-explore |
"후보" 브랜치를 관리하고, 결정 사항을 기록하며, 탐색을 신뢰할 수 있는 베이스라인과 분리합니다. |
| 격리된 브랜치에 후보 변경 적용 | explore-code |
새 브랜치를 체크아웃하고 패치를 적용하여 실행 준비를 합니다. |
| 제한된 후보 실험 실행 | explore-run |
동일한 증거 캡처 규칙 하에서 패치된 코드를 실행합니다. |
증거 번들 (실행 후 얻는 것)
repro_outputs/ANNOTATED_README.md– 각 제목 뒤에 작은 배지 스타일의 평가가 추가된 원본 README.SUMMARY.md,COMMANDS.md,LOG.md,status.json– 인간이 읽기 쉬운 요약과 기계가 읽을 수 있는 상태 정보.PATCHES.md,SCIENTIFIC_CHANGELOG.md,COMPARABILITY_REPORT.md– 코드 변경 사항과 과학적 주장에 미치는 영향을 설명하는 선택적 파일._runtime/<run_id>/– 진단용으로 사용 가능한 프로세스 스냅샷, 리소스 샘플, stdout/stderr.agent_state.json,trajectory.jsonl– 언어 모델 러너를 사용한 경우, 모델의 도구 호출 이력과 사용 메트릭이 포함됩니다.
검증 및 신뢰성
- 로컬 회귀 테스트 세트:
python scripts/run_all_tests.py는 2026-09-07 기준 리포지토리 자체의 자가 테스트에서 69/69 성공을 보고합니다. CI 배지에서는 Windows, Linux, macOS에서의 성공을 확인할 수 있습니다. - 외부 사례 연구: README에는 재현 가능한 사례 연구 4건( micrograd, minGPT, PyTorch-MNIST, nanoGPT-Shakespeare)이 나와 있습니다. 각 사례는 바이트 단위로 원본 README를 보존하며, 섹션 수준의 증거 카드를 추가합니다. 네 가지 외부 프로토콜 모두 결정론적 벤치마크 스위트를 통과했습니다.
- 제한된 실행: 도구는 호스트 환경에서 명령어를 실행하지만, 대용량 다운로드나 장시간 학습에 대해 명시적인 사용자 승인을 요구합니다. OS 수준의 사전 환경은 제공되지 않으며, 사용자는 타겟 리포지토리에 대한 신뢰를 가져야 합니다.
- 모델 루프 상태: 선택적 Anthropic 기반 모델 러너가 포함되어 있지만, README에서는 아직 라이브 모델 실행이 성공하지 못했습니다 (3회 시도에서 HTTP 502 반환). 따라서 러너는 실험적이며, 핵심 재현 워크플로우에는 필수적이지 않습니다.
제한 및 개선 과제
- OS 사전 환경 없음 – 명령어는 호스트 파일 시스템과 네트워크에 접근 가능하며, 보안은 사용자가 소스 리포지토리를 신뢰하는 데 달려 있습니다.
- 모델 러너 아직 작동 중 아님 – "스탠드얼론 모델 러너"에는 성공한 라이브 모델 수용 기록이 아직 없습니다.
- 부분적 사례 – 일부 소개된 리포지토리(예: minGPT)는 선택 전용 또는 부분적으로 표시됨. 워크플로우를 보여주지만, 전체 학습을 완료하거나 논문에서 보고된 점수에 도달하지는 못함.
- 리소스 할당량은 소프트 – 시스템은 예산을 확인하지만, 하드 OS 제한은 적용하지 않음. 대규모 GPU 작업은 수동으로 감시해야 함.
- 탐색 결과는 자동 승격되지 않음 – 후보 실험은 인간이 명시적으로 병합하지 않는 한 신뢰할 수 있는 베이스라인과 분리된 상태로 유지됨.
누구에게 적합한가
- 논문의 주장을 검증하기 위해 재현 가능하고 감사 가능한 파이프라인을 필요로 하는 AI 연구 재현 감사자.
- 스킬 API를 호출하여 실험을 자동으로 실행하고 문서화할 수 있는 LLM 기반 연구 어시스턴트.
- 기존 README 위에 겹쳐 사용 가능한 표준 "증거 카드" 형식을 찾는 재현성 플랫폼 개발자.
라이선스 및 커뮤니티
- MIT 라이선스, 오픈소스.
- 리포지토리에는 기여 가이드라인, 보안 정책, 엔지니어링 로드맵이 제공됨.
- 프로젝트는 Skillselion 리더보드에 등재되었으며,
skills.sh생태계와 통합됨.
결론 – RigorPilot Skills는 연구 논문이 기술한 명령어를 구조적이고 감사 가능한 방식으로 실행할 수 있는 진정한 소프트웨어 프로젝트입니다. 원본 README를 보존하면서 기계 검증 가능한 증거를 추가합니다. AI 연구 재현의 엄밀성을 높이기 위해 설계되었으며, LLM 에이전트나 명령줄에서 호출할 수 있는 재사용 가능한 "스킬" 세트를 제공합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트