Giskard-AI/giskard-oss

🐢 Open-Source Evaluation & Testing library for LLM Agents

해결하는 문제

Giskard는 AI 에이전트와 LLM 기반 시스템의 비결정성 특성을 다루기 위해 설계되었으며, 기존의 단위 테스트로는 부족한 상황을 해결합니다. 이 프레임워크는 이러한 시스템의 테스트, 평가, 레드팀 활동을 가능하게 하여, 회귀 문제를 탐지하고, RAG(Retrieval-Augmented Generation) 품질을 검증하며, 적대적 공격에 대한 안전성과 보안을 보장합니다.

작동 방식

프로젝트는 모듈형 패키지로 구성되어 있습니다:

  • Giskard Checks: 테스트 대상 시스템(타겟), 상황(상호작용 및 체크), 체크(어설션 또는 LLM-as-judge 평가)를 사용하여 평가(evals)를 생성하는 라이브러리입니다. 다단계 대화를 지원하며, 근거성과 일관성에 대한 내장된 평가자도 제공합니다.
  • Giskard Scan: 에이전트에 대한 일반 언어 설명을 기반으로 자동으로 적대적 테스트 세트를 생성하는 레드팀 계층입니다. 프롬프트 인젝션, 해로운 콘텐츠, 오보 정보와 같은 취약점을 타겟으로 하며, OWASP LLM Top-10 위협을 커버합니다.
  • 기반 라이브러리: giskard-core, giskard-llm(프로바이더에 의존하지 않는 라우팅), giskard-agents(오케스트레이션)는 기반 인프라를 제공합니다.

대상 사용자

LLM 기반 에이전트, RAG 파이프라인, 다단계 AI 워크플로우를 구축하는 개발자 및 AI 엔지니어로, 배포 전에 시스템의 견고성, 안전성, 신뢰성을 보장하고자 하는 분들입니다.

주요 특징

  • LLM-as-Judge: LLM을 사용하여 에이전트 응답의 품질과 근거성을 평가합니다.
  • 자동 레드팀 활동: 적대적 입력을 자동으로 생성하여 취약점과 프롬프트 인젝션을 탐지합니다.
  • 모듈형 아키텍처: 가벼운 패키지로, 동기/비동기 호출 가능한 어떤 함수도 타겟으로 감쌀 수 있습니다.
  • RAG 평가: 지식 기반의 품질과 근거성 평가를 위한 전용 도구를 제공합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트