Giskard-AI/giskard-oss

🐢 Open-Source Evaluation & Testing library for LLM Agents

What it solves

它提供了一个用于测试和评估代理系统以及基于 LLM 的应用的框架。它解决了传统单元测试在非确定性输出上失效的难题,并帮助开发者识别提示注入、数据泄漏以及 RAG 系统幻觉等漏洞。

How it works

Giskard 以模块化的 Python 包组织,可包装任何 LLM、黑箱代理或流水线:

  • Giskard Checks:使用 scenario API 创建评估(evals)的库。支持简单断言、正则、语义相似度以及 “LLM-as-judge” 评估(例如检查 groundedness 或 conformity)。
  • Giskard Scan:自动化红队工具,根据对代理的自然语言描述生成对抗测试套件,以探测安全威胁(OWASP LLM Top-10)、刻板印象和错误信息。
  • RAG Evaluation:直接从知识库生成合成测试集(问题、参考答案和上下文),用于验证 RAG 的质量。

Who it’s for

AI 开发者和 QA 工程师,构建 LLM 代理、RAG 流水线和多轮对话系统,需要确保安全性、可靠性和性能。

Highlights

  • Modular Architecture:轻量化包(giskard-checksgiskard-scan),依赖极少。
  • Async-first:为 AI 代理的动态多轮测试而设计。
  • Automated Red-Teaming:自动生成对抗输入,以测试提示注入和有害内容。
  • LLM-as-Judge:内置支持复杂评估,如 groundedness 与 conformity。