lllllllama/RigorPilot-Skills

README-first research reproduction skills with bounded execution, auditable evidence, and byte-preserving README annotations.

RigorPilot Skills – 通过可审计证据复现AI研究README

是什么 – RigorPilot Skills是一组与代理兼容的“技能”,允许AI助手(或使用skills CLI的人类)自动运行研究仓库README中记录的命令,捕获精确输出,并将简洁的证据卡插入到README中。原始文件保持不变;该工具会生成一个并排注释的副本(RIGORPILOT_README.md),显示每个部分的命令是成功、被阻断,还是需要手动批准。

为何重要 – 从论文中复现结果历来非常脆弱。RigorPilot记录了过程(命令、日志、资源使用、任何偏差),并将其存储在结构化的repro_outputs/包中。这使得可以审计论文中的主张是否真正与执行内容一致,而无需重写原始文档。


快速入门(安装与运行)

# 需要 Node.js/npm(CLI 是一个小的 npm 包)
# 安装所有技能(涵盖复现、分析、安全调试等)
npx skills add lllllllama/rigorpilot-skills --all

# 或仅安装核心复现技能
npx skills add lllllllama/rigorpilot-skills --skill ai-research-reproduction
  1. 在理解技能协议的代理中打开目标仓库(例如基于LangChain的助手)。
  2. 要求代理运行ai-research-reproduction技能,并指向仓库的README。
  3. 该技能执行最小的文档化评估,将所有日志写入repro_outputs/,并在原始文件旁边生成一个注释版README。

核心功能(“技能”索引)

目标 技能名称 功能
从README复现论文实验 ai-research-reproduction 解析命令,在受限环境中运行,记录日志,并插入逐节证据卡。
纯仓库检查(无执行) analyze-project 收集元数据、依赖列表和静态代码度量。
启动数据、权重和环境 env-and-assets-bootstrap 以受控方式下载所需的数据集或模型检查点。
执行单个文档化推理/评估 minimal-run-and-audit 执行命令,捕获stdout/stderr,并生成最小证据卡。
保守训练运行 run-train 启动短时、资源受限的训练循环并记录损失曲线。
任何代码更改前的安全调试 safe-debug 运行静态分析和沙箱测试运行,标记阻塞项。
协调探索性实验 ai-research-explore 管理“候选”分支,记录决策,并将探索与可信基线分离。
在隔离分支上应用候选变更 explore-code 检出新分支,应用补丁,并为执行准备。
执行受限候选实验 explore-run 在相同的证据捕获机制下运行修补后的代码。

证据包(运行后获得的内容)

  • repro_outputs/ANNOTATED_README.md – 原始README,每个标题后附有小徽章风格的结论。
  • SUMMARY.md, COMMANDS.md, LOG.md, status.json – 人类可读摘要及机器可读状态。
  • PATCHES.md, SCIENTIFIC_CHANGELOG.md, COMPARABILITY_REPORT.md – 可选文件,描述任何代码变更及其对科学主张的影响。
  • _runtime/<run_id>/ – 原始进程快照、资源采样和stdout/stderr,用于取证检查。
  • agent_state.json, trajectory.jsonl – 若使用语言模型运行器,包含模型的工具调用历史和使用指标。

验证与可靠性

  • 本地回归测试套件python scripts/run_all_tests.py 在2026-09-07时报告仓库自测通过69/69。CI徽章显示Windows、Linux和macOS均通过。
  • 外部案例研究:README列出了四个可复现案例研究(micrograd, minGPT, PyTorch-MNIST, nanoGPT-Shakespeare)。每个案例均以字节级完整保留原始README,并添加了逐节证据卡。四个外部协议均通过了确定性基准测试套件。
  • 受限执行:工具在主机环境中运行命令,但对任何大文件下载或长时间训练均要求明确用户授权。不提供OS级沙箱;用户必须信任目标仓库。
  • 模型循环状态:包含一个可选的Anthropic基础模型运行器,但README指出目前尚未成功完成任何实时模型运行(三次尝试均返回HTTP 502)。因此运行器为实验性,非核心复现工作流所必需。

限制与待办事项

  • 无OS沙箱 – 命令可访问主机文件系统和网络;安全性依赖于用户对源仓库的信任。
  • 模型运行器尚未可用 – “独立模型运行器”尚未记录任何成功的实时模型接受。
  • 部分案例 – 部分展示仓库(如minGPT)标记为仅选择部分;它们演示了工作流,但未完成完整训练或达到论文报告的分数。
  • 资源配额为软性 – 系统检查预算但不强制硬性OS限制;大型GPU作业需手动防护。
  • 探索结果不会自动提升 – 候选实验始终与可信基线分离,除非人类明确合并。

适用人群

  • 需要可重复、可审计流水线来验证论文主张的AI研究复现审计员
  • 可调用技能API自动运行并记录实验的LLM驱动研究助手
  • 寻找可叠加于现有README的标准“证据卡”格式的复现平台开发者

许可与社区

  • MIT许可,开源。
  • 仓库提供贡献指南、安全策略和工程路线图。
  • 项目列入Skillselion排行榜,并与skills.sh生态系统集成。

核心要点 – RigorPilot Skills是一个真正的软件项目,提供结构化、可审计的方式执行研究论文中记录的命令,保留原始README的同时添加机器验证的证据。旨在提升AI研究复现的严谨性,并提供一组可从LLM代理或命令行调用的可重用“技能”。

相关

  • 项目
  • 项目
  • 项目
  • 项目