lllllllama/RigorPilot-Skills
README-first research reproduction skills with bounded execution, auditable evidence, and byte-preserving README annotations.
RigorPilot Skills – 以可稽核證據復現AI研究README
是什麼 – RigorPilot Skills 是一組 與代理相容的「技能」,讓AI助理(或使用 skills CLI 的人類)能自動執行研究倉儲 README 中所記錄的指令,捕獲精確輸出,並插入簡潔的證據卡回 README。原始檔案保持不變;工具會產生一個並排註解的副本(RIGORPILOT_README.md),顯示每個區段的指令是成功、被阻擋,還是需要手動核准。
為何重要 – 從論文中重現結果一向極其脆弱。RigorPilot 記錄了 流程(指令、日誌、資源使用、任何偏移),並儲存在結構化的 repro_outputs/ 套件中。這使得可以稽核論文中的主張是否真正與執行內容相符,而無需重寫原始文件。
快速入門(安裝與執行)
# 需要 Node.js/npm(CLI 是一個小型 npm 套件)
# 安裝所有技能(涵蓋重現、分析、安全除錯等)
npx skills add lllllllama/rigorpilot-skills --all
# 或僅安裝核心重現技能
npx skills add lllllllama/rigorpilot-skills --skill ai-research-reproduction
- 在理解 技能協定 的代理中開啟目標倉儲(例如基於 LangChain 的助理)。
- 要求代理執行
ai-research-reproduction技能,並指向倉儲的 README。 - 該技能執行最小的文件化評估,將所有日誌寫入
repro_outputs/,並在原始檔案旁產生一個註解版 README。
核心功能(「技能」索引)
| 目標 | 技能名稱 | 功能 |
|---|---|---|
| 從 README 重現論文實驗 | ai-research-reproduction |
解析指令,在受限環境中執行,記錄日誌,並插入逐區段證據卡。 |
| 純倉儲檢視(無執行) | analyze-project |
收集元資料、相依性清單與靜態程式碼度量。 |
| 啟動資料、權重與環境 | env-and-assets-bootstrap |
以受控方式下載所需的資料集或模型檢查點。 |
| 執行單一文件化推論/評估 | minimal-run-and-audit |
執行指令,捕獲 stdout/stderr,並產生最小證據卡。 |
| 保守訓練執行 | run-train |
啟動短時、資源受限的訓練迴圈並記錄損失曲線。 |
| 任何程式碼變更前的安全除錯 | safe-debug |
執行靜態分析與沙盒測試執行,標記阻塞項。 |
| 協調探索性實驗 | ai-research-explore |
管理「候選」分支,記錄決策,並將探索與可信基線分離。 |
| 在隔離分支上套用候選變更 | explore-code |
檢出新分支,套用補丁,並為執行準備。 |
| 執行受限候選實驗 | explore-run |
在相同的證據捕獲機制下執行修補後的程式碼。 |
證據套件(執行後獲得的內容)
repro_outputs/ANNOTATED_README.md– 原始 README,每個標題後附有小徽章風格的結論。SUMMARY.md,COMMANDS.md,LOG.md,status.json– 人類可讀摘要及機器可讀狀態。PATCHES.md,SCIENTIFIC_CHANGELOG.md,COMPARABILITY_REPORT.md– 可選檔案,描述任何程式碼變更及其對科學主張的影響。_runtime/<run_id>/– 原始程序快照、資源取樣和 stdout/stderr,用於鑑識檢查。agent_state.json,trajectory.jsonl– 若使用語言模型執行器,包含模型的工具呼叫歷程與使用指標。
驗證與可靠性
- 本地回歸測試套件:
python scripts/run_all_tests.py在 2026-09-07 時報告倉儲自測通過 69/69。CI 標籤顯示 Windows、Linux 和 macOS 均通過。 - 外部案例研究:README 列出四個可重現案例研究(micrograd, minGPT, PyTorch-MNIST, nanoGPT-Shakespeare)。每個案例均以位元組級完整保留原始 README,並添加逐區段證據卡。四個外部協定均通過決定性基準測試套件。
- 受限執行:工具在主機環境中執行指令,但對任何大檔案下載或長時間訓練均要求明確使用者授權。不提供 OS 級沙箱;使用者必須信任目標倉儲。
- 模型迴圈狀態:包含一個可選的 Anthropic 基礎模型執行器,但 README 指出目前尚未成功完成任何即時模型執行(三次嘗試均返回 HTTP 502)。因此執行器為實驗性,非核心重現工作流程所必需。
限制與待辦事項
- 無 OS 沙箱 – 指令可存取主機檔案系統與網路;安全性依賴使用者對來源倉儲的信任。
- 模型執行器尚未可用 – 「獨立模型執行器」尚未記錄任何成功的即時模型接受。
- 部分案例 – 部分展示倉儲(如 minGPT)標記為 僅選擇 或 部分;它們示範工作流程,但未完成完整訓練或達成論文報告的分數。
- 資源配額為軟性 – 系統檢查預算但不強制硬性 OS 限制;大型 GPU 作業需手動防護。
- 探索結果不會自動提升 – 候選實驗始終與可信基線分離,除非人類明確合併。
適用對象
- 需要可重複、可稽核流程來驗證論文主張的 AI 研究重現稽核員。
- 可呼叫技能 API 自動執行並記錄實驗的 LLM 驅動研究助理。
- 尋找可疊加於現有 README 的標準「證據卡」格式的 重現平台開發者。
授權與社群
- MIT 授權,開源。
- 倉儲提供貢獻指南、安全政策與工程路線圖。
- 項目列於 Skillselion 排行榜,並與
skills.sh生態系統整合。
結論 – RigorPilot Skills 是一個真正的軟體專案,提供結構化、可稽核的方式執行研究論文所記錄的指令,保留原始 README 的同時,加入機器驗證的證據。旨在提升 AI 研究重現的嚴謹性,並提供一組可從 LLM 代理或命令列呼叫的可重用「技能」。
相關
- 專案
- 專案
- 專案
- 專案