Giskard-AI/giskard-oss
🐢 Open-Source Evaluation & Testing library for LLM Agents
What it solves
它提供了一个用于测试和评估代理系统以及基于 LLM 的应用的框架。它解决了传统单元测试在非确定性输出上失效的难题,并帮助开发者识别提示注入、数据泄漏以及 RAG 系统幻觉等漏洞。
How it works
Giskard 以模块化的 Python 包组织,可包装任何 LLM、黑箱代理或流水线:
- Giskard Checks:使用 scenario API 创建评估(evals)的库。支持简单断言、正则、语义相似度以及 “LLM-as-judge” 评估(例如检查 groundedness 或 conformity)。
- Giskard Scan:自动化红队工具,根据对代理的自然语言描述生成对抗测试套件,以探测安全威胁(OWASP LLM Top-10)、刻板印象和错误信息。
- RAG Evaluation:直接从知识库生成合成测试集(问题、参考答案和上下文),用于验证 RAG 的质量。
Who it’s for
AI 开发者和 QA 工程师,构建 LLM 代理、RAG 流水线和多轮对话系统,需要确保安全性、可靠性和性能。
Highlights
- Modular Architecture:轻量化包(
giskard-checks、giskard-scan),依赖极少。 - Async-first:为 AI 代理的动态多轮测试而设计。
- Automated Red-Teaming:自动生成对抗输入,以测试提示注入和有害内容。
- LLM-as-Judge:内置支持复杂评估,如 groundedness 与 conformity。