fcakyon/phd-skills

PhD Research Skills for Claude Code: paper reproduction, experiment design, paper review, result comparison and more.

是什么

phd-skills 是一个为 Claude Code(Anthropic 的 AI 编程助手)设计的插件,为机器学习研究人员添加研究专用的防护机制和工作流。它是一组命令、自动触发技能、后台代理和安全脚本,使 AI 助手在执行论文复现、训练运行调试和实验对比等科学工作时更加可靠。

解决的问题

作者(一名 ML 研究人员)发现,Claude Code 会犯下代价高昂的研究专属错误:使用错误配置启动训练任务、分析错误的数据集划分、未验证就声称测试通过、不查看图表就信任生成的数字,甚至在幻觉出的路径上执行破坏性命令。每次错误都可能浪费数周的计算资源。此插件通过添加防护机制,在错误发生前就将其捕获。

如何工作

三层结构,通过一条命令即可安装,零外部依赖:

  1. 命令(共 6 个)—— 显式的斜杠命令,例如 /phd-skills:reproduce arxiv 2508.12345(从 arXiv 复现一篇论文)和 /phd-skills:xray(从 5 个维度审计一篇论文与代码和数据的一致性)。

  2. 技能(共 12 个)—— 当你用自然语言描述任务时自动触发。说“为什么我的损失在发散?”时,一个以证据为先的调试技能会运行探查;说“将 run alpha 与基线进行比较”时,一个对比技能会先将实验对齐到相同 epoch 再进行判断。

  3. 防护机制(共 11 个)—— 静默的后台检查。例如:一个新上下文的“研究同行”会基于实际成果物审查结论;一个脚本会阻止在 AI 可能幻觉出的路径上执行 rm -rf;另一个脚本会验证生成的图表是否真的被查看过;在长时间 ML 训练启动前运行预飞行检查清单。

此外还有两个后台 代理,Claude 会自动委派它们:一个 paper-auditor 会在隔离的工作树中交叉核对论文主张与代码/数据;一个 experiment-analyzer 会读取 wandb/neptune/tensorboard/mlflow 中的结果。

设计理念

README 强调 方法论胜于脚本 —— 技能教授的是方法,Claude 会为你的具体环境(wandb、本地文件等)生成代码,而不是提供僵化的工具。同时强调人工监督:每个技能都包含验证检查点,因为 AI 助手往往过早下结论。

总结

对于使用 Claude Code 进行严肃 ML 研究的任何人来说,这是一个实用的安全层——它并未增加新的 AI 能力,而是让现有的 AI 助手更不容易因可避免的错误而浪费你的计算资源。

相关