alibaba/skill-up

An evaluation and evolution tool for Agent Skills.

What it solves

skill-upは、「Agent Skills」(AIエージェントに与えられる能力)を測定、評価、および改善するための構造化された方法を提供します。アドホックなテストに代わり、再現可能な宣言的評価ループに置き換えることで、回帰を防ぎ、異なるエージェントエンジン間でスキルの向上が測定可能であることを保証します。

How it works

The toolは、評価環境、エンジン、およびテストケースがYAMLファイルで定義される宣言的構成システムを使用します。主に、ルールベース、スクリプトベース、およびエージェントベースの3つの判定戦略をサポートしています。

To close the improvement loop, it includes skill-upper, an AI agent skill that can be installed into agents like Claude Code or Codex. skill-upperは、失敗レポートを読み取り、スキルまたは評価ケースのどちらが誤っているかを診断し、コードまたはテストを修正し、自然な会話を通じて自動的に回帰ケースを追加することができます。

Who it’s for

AIエージェントのスキルを作成している開発者で、複数のエージェントエンジン(Qoder CLI、Claude Code、およびCodexなど)にわたってパフォーマンスを検証し、これらのテストをCI/CDパイプラインに統合する必要がある方向けに設計されています。

Highlights

  • Eval-to-Evolution Loop: AIエージェント(skill-upper)を使用して、失敗レポートに基づいて評価スイートを自動的に修正および拡張します。
  • Multi-Engine Support: Claude Code、Codex、およびQoder CLIを含むさまざまなエージェントエンジンと互換性があります。
  • Declarative Config: ケースと環境を定義するためにYAMLを使用し、テストの再現性とバージョン管理を可能にします。
  • CI-Ready: すべてのプルリクエストで評価を実行するための専用のGitHub Actionが含まれています。
  • Anthropic Compatibility: 既存の evals.json ファイルをそのYAML形式にインポートできます。

関連

  • Dispatch
  • Dispatch
  • Dispatch
  • プロジェクト
  • プロジェクト