Giskard-AI/giskard-oss

🐢 Open-Source Evaluation & Testing library for LLM Agents

What it solves

它提供了一個測試與評估代理系統與基於 LLM 應用的框架。它解決了傳統單元測試在非決定性輸出上失效的問題,並協助開發者找出如提示注入、資料洩漏與 RAG 系統幻覺等漏洞。

How it works

Giskard 以模組化的 Python 套件形式組織,可包裝任何 LLM、黑箱代理或管線:

  • Giskard Checks:使用 scenario API 建立評估(evals)的函式庫。支援簡單斷言、正則表達式、語意相似度以及「LLM-as-judge」評估(例如檢查 groundedness 或 conformity)。
  • Giskard Scan:自動化紅隊測試工具,根據對代理的自然語言描述產生對抗測試套件,以探測安全威脅(OWASP LLM Top-10)、刻板印象與錯誤資訊。
  • RAG Evaluation:從知識庫直接產生合成測試集(問題、參考答案與上下文),用以驗證 RAG 的品質。

Who it’s for

AI 開發者與 QA 工程師,負責建構 LLM 代理、RAG 管線與多輪對話系統,需確保安全性、可靠性與效能。

Highlights

  • Modular Architecture:輕量化套件(giskard-checksgiskard-scan),相依性極少。
  • Async-first:為 AI 代理的動態多輪測試而設計。
  • Automated Red-Teaming:自動產生對抗輸入,以測試提示注入與有害內容。
  • LLM-as-Judge:內建支援複雜評估,如 groundedness 與 conformity。