Giskard-AI/giskard-oss

🐢 Open-Source Evaluation & Testing library for LLM Agents

What it solves

에이전트 시스템 및 LLM 기반 애플리케이션을 테스트하고 평가하기 위한 프레임워크를 제공합니다. 전통적인 단위 테스트가 실패하는 비결정적 출력 테스트 문제를 해결하고, 프롬프트 인젝션, 데이터 유출, RAG 시스템의 환각 등 취약점을 식별하는 데 도움을 줍니다.

How it works

Giskard는 任意의 LLM, 블랙박스 에이전트 또는 파이프라인을 래핑할 수 있는 모듈형 Python 패키지 세트로 구성됩니다.

  • Giskard Checks: 시나리오 API를 사용해 평가(evals)를 생성하는 라이브러리입니다. 간단한 어설션, 정규식, 의미 유사도 및 "LLM-as-judge" 평가(예: groundedness 또는 conformity 검사)를 지원합니다.
  • Giskard Scan: 에이전트에 대한 자연어 설명을 기반으로 적대적 테스트 스위트를 자동 생성하는 레드팀 도구입니다. 보안 위협(OWASP LLM Top-10), 고정관념 및 허위 정보를 탐지합니다.
  • RAG Evaluation: 지식 베이스에서 직접 합성 테스트 세트(질문, 참조 답변, 컨텍스트)를 생성하여 RAG 품질을 검증합니다.

Who it’s for

LLM 에이전트, RAG 파이프라인 및 다중 턴 대화 시스템을 구축하는 AI 개발자와 QA 엔지니어를 대상으로 하며, 안전성, 신뢰성 및 성능을 보장해야 하는 경우에 적합합니다.

Highlights

  • Modular Architecture: 가벼운 패키지(giskard-checks, giskard-scan)로 의존성이 최소화되었습니다.
  • Async-first: 동적이며 다중 턴 AI 에이전트 테스트를 위해 설계되었습니다.
  • Automated Red-Teaming: 프롬프트 인젝션 및 유해 콘텐츠를 테스트하기 위해 적대적 입력을 자동으로 생성합니다.
  • LLM-as-Judge: groundedness와 conformity와 같은 복잡한 평가를 내장 지원합니다.