darkrishabh/agent-skills-eval
A test runner for agentskills.io-style AI agent skills
解決的問題
提供一種實證方法,證明『技能』(透過 SKILL.md 檔案提供的領域知識)是否真的能提升 AI 代理在特定任務上的表現。透過並行比較載入技能的模型與未載入技能的基線模型,消除基於『直覺』的評估方式。
工作原理
針對技能設定中定義的每個評估,該工具會執行相同的提示兩次:一次將 SKILL.md 內容包含在上下文中(with_skill),另一次則不包含(without_skill)。隨後,一個獨立的裁判模型會根據相同的斷言和預期輸出對兩個輸出進行評分,為每一側生成通過/失敗的結果。該系統支援 OpenAI 相容 API、自訂提供者,並可將結果輸出為可移植的 JSON/JSONL 資產或靜態 HTML 報告。
適用對象
遵循 agentskills.io 規範建構 AI 代理,並需要一種嚴謹、自動化方式來測試與迭代其模型所用領域知識的開發者。
主要亮點
- 技能 A/B 測試:直接比較基線與啟用技能的提示在性能上的提升。
- 基於裁判的評分:使用聊天模型提供帶引用的斷言,而非簡單的字串比對。
- 規範相容:完全實作
SKILL.md和evals.json的 agentskills.io 規範。 - 工具呼叫斷言:支援對使用工具呼叫的代理進行決定性檢查。
- 靈活整合:提供 CLI 以用於 CI/CD 流水線,以及 TypeScript SDK 以用於自訂儀表板。
相關
- Dispatch
- 專案
- 專案
- 專案
- 專案