lllllllama/RigorPilot-Skills

README-first research reproduction skills with bounded execution, auditable evidence, and byte-preserving README annotations.

RigorPilot Skills – 以可稽核證據復現AI研究README

是什麼 – RigorPilot Skills 是一組 與代理相容的「技能」,讓AI助理(或使用 skills CLI 的人類)能自動執行研究倉儲 README 中所記錄的指令,捕獲精確輸出,並插入簡潔的證據卡回 README。原始檔案保持不變;工具會產生一個並排註解的副本(RIGORPILOT_README.md),顯示每個區段的指令是成功、被阻擋,還是需要手動核准。

為何重要 – 從論文中重現結果一向極其脆弱。RigorPilot 記錄了 流程(指令、日誌、資源使用、任何偏移),並儲存在結構化的 repro_outputs/ 套件中。這使得可以稽核論文中的主張是否真正與執行內容相符,而無需重寫原始文件。


快速入門(安裝與執行)

# 需要 Node.js/npm(CLI 是一個小型 npm 套件)
# 安裝所有技能(涵蓋重現、分析、安全除錯等)
npx skills add lllllllama/rigorpilot-skills --all

# 或僅安裝核心重現技能
npx skills add lllllllama/rigorpilot-skills --skill ai-research-reproduction
  1. 在理解 技能協定 的代理中開啟目標倉儲(例如基於 LangChain 的助理)。
  2. 要求代理執行 ai-research-reproduction 技能,並指向倉儲的 README。
  3. 該技能執行最小的文件化評估,將所有日誌寫入 repro_outputs/,並在原始檔案旁產生一個註解版 README。

核心功能(「技能」索引)

目標 技能名稱 功能
從 README 重現論文實驗 ai-research-reproduction 解析指令,在受限環境中執行,記錄日誌,並插入逐區段證據卡。
純倉儲檢視(無執行) analyze-project 收集元資料、相依性清單與靜態程式碼度量。
啟動資料、權重與環境 env-and-assets-bootstrap 以受控方式下載所需的資料集或模型檢查點。
執行單一文件化推論/評估 minimal-run-and-audit 執行指令,捕獲 stdout/stderr,並產生最小證據卡。
保守訓練執行 run-train 啟動短時、資源受限的訓練迴圈並記錄損失曲線。
任何程式碼變更前的安全除錯 safe-debug 執行靜態分析與沙盒測試執行,標記阻塞項。
協調探索性實驗 ai-research-explore 管理「候選」分支,記錄決策,並將探索與可信基線分離。
在隔離分支上套用候選變更 explore-code 檢出新分支,套用補丁,並為執行準備。
執行受限候選實驗 explore-run 在相同的證據捕獲機制下執行修補後的程式碼。

證據套件(執行後獲得的內容)

  • repro_outputs/ANNOTATED_README.md – 原始 README,每個標題後附有小徽章風格的結論。
  • SUMMARY.md, COMMANDS.md, LOG.md, status.json – 人類可讀摘要及機器可讀狀態。
  • PATCHES.md, SCIENTIFIC_CHANGELOG.md, COMPARABILITY_REPORT.md – 可選檔案,描述任何程式碼變更及其對科學主張的影響。
  • _runtime/<run_id>/ – 原始程序快照、資源取樣和 stdout/stderr,用於鑑識檢查。
  • agent_state.json, trajectory.jsonl – 若使用語言模型執行器,包含模型的工具呼叫歷程與使用指標。

驗證與可靠性

  • 本地回歸測試套件python scripts/run_all_tests.py 在 2026-09-07 時報告倉儲自測通過 69/69。CI 標籤顯示 Windows、Linux 和 macOS 均通過。
  • 外部案例研究:README 列出四個可重現案例研究(micrograd, minGPT, PyTorch-MNIST, nanoGPT-Shakespeare)。每個案例均以位元組級完整保留原始 README,並添加逐區段證據卡。四個外部協定均通過決定性基準測試套件。
  • 受限執行:工具在主機環境中執行指令,但對任何大檔案下載或長時間訓練均要求明確使用者授權。不提供 OS 級沙箱;使用者必須信任目標倉儲。
  • 模型迴圈狀態:包含一個可選的 Anthropic 基礎模型執行器,但 README 指出目前尚未成功完成任何即時模型執行(三次嘗試均返回 HTTP 502)。因此執行器為實驗性,非核心重現工作流程所必需。

限制與待辦事項

  • 無 OS 沙箱 – 指令可存取主機檔案系統與網路;安全性依賴使用者對來源倉儲的信任。
  • 模型執行器尚未可用 – 「獨立模型執行器」尚未記錄任何成功的即時模型接受。
  • 部分案例 – 部分展示倉儲(如 minGPT)標記為 僅選擇部分;它們示範工作流程,但未完成完整訓練或達成論文報告的分數。
  • 資源配額為軟性 – 系統檢查預算但不強制硬性 OS 限制;大型 GPU 作業需手動防護。
  • 探索結果不會自動提升 – 候選實驗始終與可信基線分離,除非人類明確合併。

適用對象

  • 需要可重複、可稽核流程來驗證論文主張的 AI 研究重現稽核員
  • 可呼叫技能 API 自動執行並記錄實驗的 LLM 驅動研究助理
  • 尋找可疊加於現有 README 的標準「證據卡」格式的 重現平台開發者

授權與社群

  • MIT 授權,開源。
  • 倉儲提供貢獻指南、安全政策與工程路線圖。
  • 項目列於 Skillselion 排行榜,並與 skills.sh 生態系統整合。

結論 – RigorPilot Skills 是一個真正的軟體專案,提供結構化、可稽核的方式執行研究論文所記錄的指令,保留原始 README 的同時,加入機器驗證的證據。旨在提升 AI 研究重現的嚴謹性,並提供一組可從 LLM 代理或命令列呼叫的可重用「技能」。

相關

  • 專案
  • 專案
  • 專案
  • 專案