tripleyak/SkillForge

A skill creator that proves its skills work. Evidence-driven skill creation for Claude Code and Codex: baseline-tested generation, per-skill regression evals, ecosystem doctor, cross-runtime compile, and an opt-in proactive advisor.

何を解決するか

SkillForgeは、実際のエージェントパフォーマンスを向上させない低品質または重複するAI「スキル」(指示/プロンプト)を作成する問題に対処します。ドキュメントベースの承認から脱却し、行動ベースのアプローチを採用することで、特定のスキルがベースライン(そのスキルなし)と比較してタスクの遂行能力を実際に向上させる場合にのみ、スキルが作成されるように保証します。

動作方法

SkillForgeは、AIスキルのライフサイクルを管理するエビデンス駆動型パイプラインを使用しています:

  1. トライアージ&レッドゲート:スキルが既に存在するかを確認し、「レッドゲート」テストを実行。新規エージェントがそのスキルなしでタスクを成功させる場合、新しいスキルは作成されません。
  2. 分析&仕様:特定のレンズ(例:パレート、根本原因)を使用して失敗を分析し、階層的な仕様を作成します。
  3. 生成&グリーンゲート:サブエージェントが仕様に基づいてスキルを生成し、「グリーンゲート」テストで、以前に失敗したベースラインが今では成功するかを確認します。
  4. レビュー&リリース:アドバーサリアルエージェントによるlintとレビューを経て、独自のリグレッションテスト(evals)と共にリリースされます。

対象ユーザー

AIエージェント(特にClaude CodeおよびCodex CLI)のユーザーで、再利用可能なスキルライブラリを構築・維持・最適化したい人向けです。

特徴

  • 行動検証:レッド/グリーンゲートを使用して、スキルが実際にパフォーマンスを向上させることを証明します。
  • リグレッションテスト:各スキルは独自の evals/ フォルダと実行スクリプトを備え、継続的な動作を保証します。
  • エコシステムの健全性:すべてのスキルにわたるトリガーの衝突、重複、古くなった参照を検出する「ドクター」ツールを含みます。
  • クロスランタイム対応:スキルを一度書くだけで、Claude、Codex、AgentSkillsなど、さまざまなターゲットにコンパイル可能。
  • 摩擦マイニング:オプトイン型ツールで、ローカルセッション履歴を分析し、新たなスキルが必要なギャップを特定します。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト