Giskard-AI/giskard-oss
🐢 Open-Source Evaluation & Testing library for LLM Agents
What it solves
它提供了一個測試與評估代理系統與基於 LLM 應用的框架。它解決了傳統單元測試在非決定性輸出上失效的問題,並協助開發者找出如提示注入、資料洩漏與 RAG 系統幻覺等漏洞。
How it works
Giskard 以模組化的 Python 套件形式組織,可包裝任何 LLM、黑箱代理或管線:
- Giskard Checks:使用 scenario API 建立評估(evals)的函式庫。支援簡單斷言、正則表達式、語意相似度以及「LLM-as-judge」評估(例如檢查 groundedness 或 conformity)。
- Giskard Scan:自動化紅隊測試工具,根據對代理的自然語言描述產生對抗測試套件,以探測安全威脅(OWASP LLM Top-10)、刻板印象與錯誤資訊。
- RAG Evaluation:從知識庫直接產生合成測試集(問題、參考答案與上下文),用以驗證 RAG 的品質。
Who it’s for
AI 開發者與 QA 工程師,負責建構 LLM 代理、RAG 管線與多輪對話系統,需確保安全性、可靠性與效能。
Highlights
- Modular Architecture:輕量化套件(
giskard-checks、giskard-scan),相依性極少。 - Async-first:為 AI 代理的動態多輪測試而設計。
- Automated Red-Teaming:自動產生對抗輸入,以測試提示注入與有害內容。
- LLM-as-Judge:內建支援複雜評估,如 groundedness 與 conformity。