Giskard-AI/giskard-oss

🐢 Open-Source Evaluation & Testing library for LLM Agents

解决的问题

Giskard 旨在应对 AI 代理和基于 LLM 的系统的非确定性特性,这些特性使得传统单元测试不再足够。它提供了一个框架,用于测试、评估和红队演练这些系统,以捕获回归问题、验证 RAG(检索增强生成)质量,并确保系统在面对对抗性攻击时的安全性和安全性。

工作原理

该项目采用模块化包结构组织:

  • Giskard Checks:一个用于创建评估(evals)的库,使用“目标”(待测系统)、“场景”(交互和检查)和“检查”(断言或 LLM-as-judge 评估)。支持多轮对话和内置的连贯性与事实性评估器。
  • Giskard Scan:一个红队层,可根据对代理的自然语言描述自动生成对抗性测试套件。其目标是发现提示注入、有害内容和错误信息等漏洞,覆盖 OWASP LLM Top-10 威胁。
  • 基础库giskard-coregiskard-llm(与提供者无关的路由)、giskard-agents(编排)提供底层基础设施。

适用人群

构建基于 LLM 的代理、RAG 流水线和多步骤 AI 工作流的开发者和 AI 工程师,他们需要在部署前确保系统的稳健性、安全性和可靠性。

主要亮点

  • LLM-as-Judge:使用 LLM 评估代理响应的质量和事实性。
  • 自动化红队演练:自动生成对抗性输入,以探测漏洞和提示注入。
  • 模块化架构:轻量级包,允许用户将任何同步/异步可调用对象包装为测试目标。
  • RAG 评估:提供专门用于评估知识库质量和事实性的工具。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目