Giskard-AI/giskard-oss

🐢 Open-Source Evaluation & Testing library for LLM Agents

解決的問題

Giskard 是為應對 AI 代理與基於 LLM 的系統的非決定性特性而設計,傳統單元測試在這些情境下已顯不足。它提供一個框架,用於測試、評估與紅隊演練這些系統,以捕捉回歸問題、驗證 RAG(檢索增強生成)品質,並確保系統在面對對抗性攻擊時的安全性與可靠性。

工作原理

專案採用模組化套件結構:

  • Giskard Checks:一個用於建立評估(evals)的程式庫,使用「目標」(待測系統)、「情境」(互動與檢查)與「檢查」(斷言或 LLM-as-judge 評估)。支援多輪對話與內建的根據性與一致性評估器。
  • Giskard Scan:一個紅隊層,可根據對代理的自然語言描述自動產生對抗性測試套件。目標是發現提示注入、有害內容與錯誤資訊等弱點,涵蓋 OWASP LLM Top-10 威脅。
  • 基礎程式庫giskard-coregiskard-llm(與提供者無關的路由)、giskard-agents(編排)提供底層基礎設施。

適用對象

開發基於 LLM 的代理、RAG 流水線與多階段 AI 工作流程的開發者與 AI 工程師,他們需要在部署前確保系統的穩健性、安全性與可靠性。

主要亮點

  • LLM-as-Judge:使用 LLM 評估代理回應的品質與根據性。
  • 自動化紅隊演練:自動產生對抗性輸入,以探測弱點與提示注入。
  • 模組化架構:輕量級套件,允許使用者將任何同步/非同步可呼叫物件包裝為目標。
  • RAG 評估:提供專用工具,用於評估知識庫品質與根據性。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案