alibaba/skill-up

An evaluation and evolution tool for Agent Skills.

它解决了什么问题

skill-up 提供了一种结构化的方式来衡量、评估和改进“Agent Skills”(赋予 AI agent 的能力)。它将临时测试取代为可重复、声明式的评估循环,从而防止回归并确保技能改进在不同的 agent engine 之间是可衡量的。

工作原理

该工具使用声明式配置系统,其中评估环境、engine 和测试用例均在 YAML 文件中定义。它支持三种主要的评判策略:基于规则的、基于脚本的以及基于 agent 的评判器。

适用对象

它专为创建 AI agent skill 的开发者设计,这些开发者需要跨多个 agent engine(例如 Qoder CLI、Claude Code 和 Codex)验证其性能,并将这些测试集成到 CI/CD 流水线中。

亮点

  • Eval-to-Evolution Loop:使用 AI agent(skill-upper)根据失败报告自动修复并扩展评估套件。
  • 多引擎支持:兼容各种 agent engine,包括 Claude Code、Codex 和 Qoder CLI。
  • 声明式配置:使用 YAML 定义用例和环境,使测试具有可重复性和版本控制能力。
  • CI 就绪:包含专门的 GitHub Action 用于在每个 pull request 上运行评估。
  • Anthropic 兼容性:可以将现有的 evals.json 文件导入其 YAML 格式。

相关

  • Dispatch
  • Dispatch
  • Dispatch
  • 项目
  • 项目