Giskard-AI/giskard-oss
🐢 Open-Source Evaluation & Testing library for LLM Agents
解決的問題
Giskard 是為應對 AI 代理與基於 LLM 的系統的非決定性特性而設計,傳統單元測試在這些情境下已顯不足。它提供一個框架,用於測試、評估與紅隊演練這些系統,以捕捉回歸問題、驗證 RAG(檢索增強生成)品質,並確保系統在面對對抗性攻擊時的安全性與可靠性。
工作原理
專案採用模組化套件結構:
- Giskard Checks:一個用於建立評估(evals)的程式庫,使用「目標」(待測系統)、「情境」(互動與檢查)與「檢查」(斷言或 LLM-as-judge 評估)。支援多輪對話與內建的根據性與一致性評估器。
- Giskard Scan:一個紅隊層,可根據對代理的自然語言描述自動產生對抗性測試套件。目標是發現提示注入、有害內容與錯誤資訊等弱點,涵蓋 OWASP LLM Top-10 威脅。
- 基礎程式庫:
giskard-core、giskard-llm(與提供者無關的路由)、giskard-agents(編排)提供底層基礎設施。
適用對象
開發基於 LLM 的代理、RAG 流水線與多階段 AI 工作流程的開發者與 AI 工程師,他們需要在部署前確保系統的穩健性、安全性與可靠性。
主要亮點
- LLM-as-Judge:使用 LLM 評估代理回應的品質與根據性。
- 自動化紅隊演練:自動產生對抗性輸入,以探測弱點與提示注入。
- 模組化架構:輕量級套件,允許使用者將任何同步/非同步可呼叫物件包裝為目標。
- RAG 評估:提供專用工具,用於評估知識庫品質與根據性。
相關
- 專案
- 專案
- 專案
- 專案
- 專案