lllllllama/RigorPilot-Skills
README-first research reproduction skills with bounded execution, auditable evidence, and byte-preserving README annotations.
RigorPilot Skills – 通过可审计证据复现AI研究README
是什么 – RigorPilot Skills是一组与代理兼容的“技能”,允许AI助手(或使用skills CLI的人类)自动运行研究仓库README中记录的命令,捕获精确输出,并将简洁的证据卡插入到README中。原始文件保持不变;该工具会生成一个并排注释的副本(RIGORPILOT_README.md),显示每个部分的命令是成功、被阻断,还是需要手动批准。
为何重要 – 从论文中复现结果历来非常脆弱。RigorPilot记录了过程(命令、日志、资源使用、任何偏差),并将其存储在结构化的repro_outputs/包中。这使得可以审计论文中的主张是否真正与执行内容一致,而无需重写原始文档。
快速入门(安装与运行)
# 需要 Node.js/npm(CLI 是一个小的 npm 包)
# 安装所有技能(涵盖复现、分析、安全调试等)
npx skills add lllllllama/rigorpilot-skills --all
# 或仅安装核心复现技能
npx skills add lllllllama/rigorpilot-skills --skill ai-research-reproduction
- 在理解技能协议的代理中打开目标仓库(例如基于LangChain的助手)。
- 要求代理运行
ai-research-reproduction技能,并指向仓库的README。 - 该技能执行最小的文档化评估,将所有日志写入
repro_outputs/,并在原始文件旁边生成一个注释版README。
核心功能(“技能”索引)
| 目标 | 技能名称 | 功能 |
|---|---|---|
| 从README复现论文实验 | ai-research-reproduction |
解析命令,在受限环境中运行,记录日志,并插入逐节证据卡。 |
| 纯仓库检查(无执行) | analyze-project |
收集元数据、依赖列表和静态代码度量。 |
| 启动数据、权重和环境 | env-and-assets-bootstrap |
以受控方式下载所需的数据集或模型检查点。 |
| 执行单个文档化推理/评估 | minimal-run-and-audit |
执行命令,捕获stdout/stderr,并生成最小证据卡。 |
| 保守训练运行 | run-train |
启动短时、资源受限的训练循环并记录损失曲线。 |
| 任何代码更改前的安全调试 | safe-debug |
运行静态分析和沙箱测试运行,标记阻塞项。 |
| 协调探索性实验 | ai-research-explore |
管理“候选”分支,记录决策,并将探索与可信基线分离。 |
| 在隔离分支上应用候选变更 | explore-code |
检出新分支,应用补丁,并为执行准备。 |
| 执行受限候选实验 | explore-run |
在相同的证据捕获机制下运行修补后的代码。 |
证据包(运行后获得的内容)
repro_outputs/ANNOTATED_README.md– 原始README,每个标题后附有小徽章风格的结论。SUMMARY.md,COMMANDS.md,LOG.md,status.json– 人类可读摘要及机器可读状态。PATCHES.md,SCIENTIFIC_CHANGELOG.md,COMPARABILITY_REPORT.md– 可选文件,描述任何代码变更及其对科学主张的影响。_runtime/<run_id>/– 原始进程快照、资源采样和stdout/stderr,用于取证检查。agent_state.json,trajectory.jsonl– 若使用语言模型运行器,包含模型的工具调用历史和使用指标。
验证与可靠性
- 本地回归测试套件:
python scripts/run_all_tests.py在2026-09-07时报告仓库自测通过69/69。CI徽章显示Windows、Linux和macOS均通过。 - 外部案例研究:README列出了四个可复现案例研究(micrograd, minGPT, PyTorch-MNIST, nanoGPT-Shakespeare)。每个案例均以字节级完整保留原始README,并添加了逐节证据卡。四个外部协议均通过了确定性基准测试套件。
- 受限执行:工具在主机环境中运行命令,但对任何大文件下载或长时间训练均要求明确用户授权。不提供OS级沙箱;用户必须信任目标仓库。
- 模型循环状态:包含一个可选的Anthropic基础模型运行器,但README指出目前尚未成功完成任何实时模型运行(三次尝试均返回HTTP 502)。因此运行器为实验性,非核心复现工作流所必需。
限制与待办事项
- 无OS沙箱 – 命令可访问主机文件系统和网络;安全性依赖于用户对源仓库的信任。
- 模型运行器尚未可用 – “独立模型运行器”尚未记录任何成功的实时模型接受。
- 部分案例 – 部分展示仓库(如minGPT)标记为仅选择或部分;它们演示了工作流,但未完成完整训练或达到论文报告的分数。
- 资源配额为软性 – 系统检查预算但不强制硬性OS限制;大型GPU作业需手动防护。
- 探索结果不会自动提升 – 候选实验始终与可信基线分离,除非人类明确合并。
适用人群
- 需要可重复、可审计流水线来验证论文主张的AI研究复现审计员。
- 可调用技能API自动运行并记录实验的LLM驱动研究助手。
- 寻找可叠加于现有README的标准“证据卡”格式的复现平台开发者。
许可与社区
- MIT许可,开源。
- 仓库提供贡献指南、安全策略和工程路线图。
- 项目列入Skillselion排行榜,并与
skills.sh生态系统集成。
核心要点 – RigorPilot Skills是一个真正的软件项目,提供结构化、可审计的方式执行研究论文中记录的命令,保留原始README的同时添加机器验证的证据。旨在提升AI研究复现的严谨性,并提供一组可从LLM代理或命令行调用的可重用“技能”。
相关
- 项目
- 项目
- 项目
- 项目