fcakyon/phd-skills
PhD Research Skills for Claude Code: paper reproduction, experiment design, paper review, result comparison and more.
何であるか
phd-skills は、Claude Code(AnthropicのAIコーディングアシスタント)向けのプラグインで、機械学習研究者向けの研究固有のガードレールとワークフローを追加します。論文の再現、トレーニング実行のデバッグ、実験比較などの科学的作業において、AIアシスタントの信頼性を高めるための、コマンド、自動起動スキル、バックグラウンドエージェント、およびセーフティスクリプトのセットです。
解決する問題
著者(ML研究者)は、Claude Codeが高コストな研究固有のミスを犯すことに気づきました:誤った設定でトレーニングを開始、誤ったデータセット分割を分析、検証せずにテストが成功したと主張、図を確認せずに生成された数値を信頼、幻覚されたパス上で破壊的なコマンドを実行するなど。各ミスは数週間分のコンピューティングリソースを無駄にします。このプラグインは、こうしたミスが発生する前に検出するガードレールを追加します。
動作方法
外部依存なしで1つのコマンドでインストール可能な3層構造です:
コマンド(6つ)— 明示的なスラッシュコマンド、例:
/phd-skills:reproduce arxiv 2508.12345(arXivから論文を再現)や/phd-skills:xray(コードとデータの5次元にわたる論文の監査)。スキル(12つ)— 平文でタスクを説明すると自動起動します。"なぜ私の損失が発散しているのか?" と尋ねると、証拠中心の調査を実行するデバッグスキルが起動;"run alphaをベースラインと比較" と述べると、評価前に同じエポックで実験を揃える比較スキルが起動します。
ガードレール(11つ)— 静かにバックグラウンドでチェック。例:新規コンテキストの「研究者同士」が実際の成果物に基づいて結論をレビュー;AIが幻覚したパス上で
rm -rfをブロックするスクリプト;生成された図が実際に確認されたかを検証するスクリプト;長時間のMLトレーニング開始前にプリフライトチェックリストが実行。
さらに、2つのバックグラウンドエージェントも自動的にClaudeが委任します:paper-auditor は隔離されたワークツリーで論文の主張をコード/データと照合;experiment-analyzer は wandb/neptune/tensorboard/mlflow からの結果を読み取ります。
デザイン哲学
READMEはスクリプトよりもメソドロジーを重視しています — スキルはアプローチを教えるだけで、Claudeが特定の環境(wandb、ローカルファイルなど)に合わせてコードを生成するため、硬直的なツールを提供しません。また、人間の監視の重要性も強調:AIアシスタントは早計な主張をしがちなので、すべてのスキルに検証チェックポイントが含まれています。
まとめ
Claude Codeで本格的なML研究を行うすべての人にとって実用的なセーフティレイヤーです — 新たなAI能力を追加するのではなく、既存のAIアシスタントが避けられるミスで貴重なコンピューティングリソースを無駄にしないようにします。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト