alibaba/skill-up
An evaluation and evolution tool for Agent Skills.
它解决了什么问题
skill-up 提供了一种结构化的方式来衡量、评估和改进“Agent Skills”(赋予 AI agent 的能力)。它将临时测试取代为可重复、声明式的评估循环,从而防止回归并确保技能改进在不同的 agent engine 之间是可衡量的。
工作原理
该工具使用声明式配置系统,其中评估环境、engine 和测试用例均在 YAML 文件中定义。它支持三种主要的评判策略:基于规则的、基于脚本的以及基于 agent 的评判器。
适用对象
它专为创建 AI agent skill 的开发者设计,这些开发者需要跨多个 agent engine(例如 Qoder CLI、Claude Code 和 Codex)验证其性能,并将这些测试集成到 CI/CD 流水线中。
亮点
- Eval-to-Evolution Loop:使用 AI agent(skill-upper)根据失败报告自动修复并扩展评估套件。
- 多引擎支持:兼容各种 agent engine,包括 Claude Code、Codex 和 Qoder CLI。
- 声明式配置:使用 YAML 定义用例和环境,使测试具有可重复性和版本控制能力。
- CI 就绪:包含专门的 GitHub Action 用于在每个 pull request 上运行评估。
- Anthropic 兼容性:可以将现有的
evals.json文件导入其 YAML 格式。
相关
- Dispatch
- Dispatch
- Dispatch
- 项目
- 项目