alibaba/skill-up
An evaluation and evolution tool for Agent Skills.
它解決了什麼問題
skill-up 提供了一種結構化的方式來衡量、評估與改進「Agent Skills」(賦予 AI 代理人的能力)。它以可重複、宣告式的評估迴圈取代臨時測試,防止回歸,並確保技能改進在不同代理引擎間皆可量化。
它如何運作
此工具使用宣告式的設定系統,透過 YAML 檔案定義評估環境、引擎與測試案例。它支援三種主要的評審策略:規則式、腳本式與代理式評審者。
為了關閉改進迴圈,它內建 skill-upper,一個可安裝於 Claude Code 或 Codex 等代理中的 AI 代理技能。skill‑upper 能閱讀失敗報告、診斷是技能本身還是評估案例有誤、修復程式碼或測試,並透過自然對話自動加入回歸案例。
目標使用者
此工具針對開發 AI 代理技能的開發者設計,這些開發者需要在多個代理引擎(如 Qoder CLI、Claude Code、Codex)上驗證其效能,並將這些測試整合至 CI/CD 流程中。
重點特色
- Eval-to-Evolution Loop:使用 AI 代理(skill‑upper)根據失敗報告自動修復與擴充評估套件。
- 多引擎支援:相容於包括 Claude Code、Codex 與 Qoder CLI 在內的各種代理引擎。
- 宣告式設定:使用 YAML 定義案例與環境,使測試可重複且可版本控制。
- CI 就緒:提供專屬的 GitHub Action,於每次 Pull Request 執行評估。
- Anthropic 相容性:可將現有的
evals.json檔案匯入為 YAML 格式。
相關
- Dispatch
- Dispatch
- Dispatch
- 專案
- 專案