darkrishabh/agent-skills-eval

A test runner for agentskills.io-style AI agent skills

解决的问题

提供一种实证方法,证明‘技能’(通过 SKILL.md 文件提供的领域知识)是否真的能提升 AI 代理在特定任务上的表现。通过并行比较加载了技能的模型与未加载技能的基线模型,消除了基于‘感觉’的评估方式。

工作原理

对于技能配置中定义的每个评估,该工具会运行相同的提示两次:一次将 SKILL.md 内容包含在上下文中(with_skill),另一次则不包含(without_skill)。随后,一个独立的裁判模型会根据相同的断言和预期输出对两个输出进行评分,为每一侧生成通过/失败的结果。该系统支持 OpenAI 兼容 API、自定义提供者,并可将结果输出为可移植的 JSON/JSONL 资产或静态 HTML 报告。

适用人群

遵循 agentskills.io 规范构建 AI 代理,并需要一种严格、自动化的方式来测试和迭代其模型所用领域知识的开发者。

主要亮点

  • 技能 A/B 测试:直接比较基线与启用技能的提示在性能上的提升。
  • 基于裁判的评分:使用聊天模型提供带引用的断言,而非简单的字符串匹配。
  • 规范兼容:完全实现 SKILL.mdevals.json 的 agentskills.io 规范。
  • 工具调用断言:支持对使用工具调用的代理进行确定性检查。
  • 灵活集成:提供 CLI 以用于 CI/CD 流水线,以及 TypeScript SDK 以用于自定义仪表板。

相关

  • Dispatch
  • 项目
  • 项目
  • 项目
  • 项目