lllllllama/RigorPilot-Skills

README-first research reproduction skills with bounded execution, auditable evidence, and byte-preserving README annotations.

RigorPilot Skills – 証跡可能な証拠でAI研究のREADMEを再現する

何であるか – RigorPilot Skillsは、AIアシスタント(またはskills CLIを使用する人間)が研究リポジトリのREADMEに記載されたコマンドを自動的に実行し、正確な出力をキャプチャし、READMEに簡潔な証拠カードを挿入できる*エージェント互換の「スキル」*のコレクションです。元のファイルは変更されません。ツールは、各セクションが成功したか、ブロックされたか、手動承認が必要かを示す、並べて表示された注釈付きコピー(RIGORPILOT_README.md)を生成します。

なぜ重要か – 論文の結果を再現することは、非常に脆弱です。RigorPilotはプロセス(コマンド、ログ、リソース使用量、すべての逸脱)を記録し、構造化されたバンドル(repro_outputs/)に保存します。これにより、論文の主張が実際に実行された内容と一致しているかどうかを監査可能にし、元のドキュメントを書き換えることなく検証できます。


クイックスタート(インストール&実行)

# Node.js/npmが必要(CLIは小さなnpmパッケージ)
# すべてのスキルをインストール(再現、分析、安全なデバッグなどに対応)
npx skills add lllllllama/rigorpilot-skills --all

# または、コアの再現スキルのみをインストール
npx skills add lllllllama/rigorpilot-skills --skill ai-research-reproduction
  1. スキルプロトコルを理解するエージェント(例:LangChainベースのアシスタント)でターゲットリポジトリを開く。
  2. エージェントにai-research-reproductionスキルを実行させ、リポジトリのREADMEを指定する。
  3. スキルは最小限の文書化された評価を実行し、すべてのログをrepro_outputs/に書き込み、元のファイルの隣に注釈付きREADMEを生成する。

コア機能(「スキル」インデックス)

目的 スキル名 機能
論文の実験をREADMEから再現 ai-research-reproduction コマンドを解析し、制限付き環境で実行し、ログを記録し、セクションごとの証拠カードを挿入する。
純粋なリポジトリの検査(実行なし) analyze-project メタデータ、依存関係リスト、静的コードメトリクスを収集する。
データ、重み、環境のブートストラップ env-and-assets-bootstrap 制御された方法で必要なデータセットやモデルチェックポイントをダウンロードする。
1つの文書化された推論/評価の実行 minimal-run-and-audit コマンドを実行し、stdout/stderrをキャプチャし、最小限の証拠カードを生成する。
保守的なトレーニング実行 run-train 短時間でリソース制限付きのトレーニングループを開始し、損失曲線を記録する。
何らかのコード変更前の安全なデバッグ safe-debug 静的解析とサンドボックステストを実行し、ブロッカーを特定する。
協調的な探索的実験 ai-research-explore 「候補」ブランチを管理し、意思決定を記録し、探索を信頼できるベースラインから分離する。
隔離されたブランチに候補変更を適用 explore-code 新しいブランチをチェックアウトし、パッチを適用し、実行準備を整える。
制限付きの候補実験を実行 explore-run 同じ証拠収集ルールの下でパッチ適用済みコードを実行する。

証拠バンドル(実行後の成果物)

  • repro_outputs/ANNOTATED_README.md – 各見出しの後に小さなバッジスタイルの評価が付加された元のREADME。
  • SUMMARY.md, COMMANDS.md, LOG.md, status.json – 人間が読みやすい要約と機械可読なステータス。
  • PATCHES.md, SCIENTIFIC_CHANGELOG.md, COMPARABILITY_REPORT.md – 任意のコード変更とそれが科学的主張に与える影響を説明するファイル。
  • _runtime/<run_id>/ – 診断用に使用可能なプロセススナップショット、リソースサンプル、stdout/stderr。
  • agent_state.json, trajectory.jsonl – 言語モデルランナーを使用した場合、モデルのツールコール履歴と使用メトリクスが含まれる。

検証と信頼性

  • ローカルの回帰テストスイートpython scripts/run_all_tests.pyは、2026-09-07時点でのリポジトリ自身の自己テストで69/69の成功を報告。CIバッジはWindows、Linux、macOSでの成功を示す。
  • 外部ケーススタディ:READMEには4つの再現可能なケーススタディ(micrograd, minGPT, PyTorch-MNIST, nanoGPT-Shakespeare)がリストアップされている。各ケースは、バイト単位で元のREADMEを保持し、セクションレベルの証拠カードを付加。4つの外部プロトコルすべてが決定論的ベンチマークスイートを通過。
  • 制限付き実行:ツールはホスト環境でコマンドを実行するが、大規模なダウンロードや長時間実行のトレーニングに対して明示的なユーザー承認を要求する。OSレベルのサンドボックスは提供されないため、ユーザーはターゲットリポジトリへの信頼に依存する必要がある。
  • モデルループの状態:オプションのAnthropicベースのモデルランナーが含まれているが、READMEではまだライブモデル実行が成功していない(3回の試行でHTTP 502が返された)。したがってランナーは実験的であり、コアの再現ワークフローには必須ではない。

制限と未解決課題

  • OSサンドボックスなし – コマンドはホストファイルシステムとネットワークにアクセス可能。セキュリティは、ユーザーがソースリポジトリを信頼することに依存。
  • モデルランナーはまだ機能しない – 「スタンドアロンモデルランナー」には、成功したライブモデル受容記録がまだない。
  • 部分的なケース – 一部の紹介リポジトリ(例:minGPT)は選択のみまたは部分的とマークされている。ワークフローを示すが、完全なトレーニングは完了せず、論文で報告されたスコアにも到達していない。
  • リソースクォータはソフト – システムは予算をチェックするが、OSレベルのハード制限は課さない。大規模なGPUジョブは手動で監視する必要がある。
  • 探索結果は自動的に昇格されない – 候補実験は、人間が明示的にマージしない限り、信頼できるベースラインとは分離されたままになる。

どのような人が使うか

  • 論文の主張を検証するための再現可能で監査可能なパイプラインが必要なAI研究再現監査者
  • スキルAPIを呼び出して実験を自動実行・ドキュメント化できるLLM駆動の研究アシスタント
  • 既存のREADMEに重ねて利用可能な標準的な「証拠カード」フォーマットを探している再現性プラットフォーム開発者

ライセンスとコミュニティ

  • MITライセンス、オープンソース。
  • リポジトリには貢献ガイドライン、セキュリティポリシー、エンジニアリングロードマップが提供されている。
  • プロジェクトはSkillselionリーダーボードに掲載され、skills.shエコシステムと統合されている。

結論 – RigorPilot Skillsは、研究論文が記述するコマンドを構造的かつ監査可能な方法で実行する本格的なソフトウェアプロジェクトです。元のREADMEを保持しながら、機械検証可能な証拠を追加します。AI研究の再現性を高める目的で設計されており、LLMエージェントやコマンドラインから呼び出せる再利用可能な「スキル」のセットを提供しています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト