Giskard-AI/giskard-oss
🐢 Open-Source Evaluation & Testing library for LLM Agents
해결하는 문제
Giskard는 AI 에이전트와 LLM 기반 시스템의 비결정성 특성을 다루기 위해 설계되었으며, 기존의 단위 테스트로는 부족한 상황을 해결합니다. 이 프레임워크는 이러한 시스템의 테스트, 평가, 레드팀 활동을 가능하게 하여, 회귀 문제를 탐지하고, RAG(Retrieval-Augmented Generation) 품질을 검증하며, 적대적 공격에 대한 안전성과 보안을 보장합니다.
작동 방식
프로젝트는 모듈형 패키지로 구성되어 있습니다:
- Giskard Checks: 테스트 대상 시스템(타겟), 상황(상호작용 및 체크), 체크(어설션 또는 LLM-as-judge 평가)를 사용하여 평가(evals)를 생성하는 라이브러리입니다. 다단계 대화를 지원하며, 근거성과 일관성에 대한 내장된 평가자도 제공합니다.
- Giskard Scan: 에이전트에 대한 일반 언어 설명을 기반으로 자동으로 적대적 테스트 세트를 생성하는 레드팀 계층입니다. 프롬프트 인젝션, 해로운 콘텐츠, 오보 정보와 같은 취약점을 타겟으로 하며, OWASP LLM Top-10 위협을 커버합니다.
- 기반 라이브러리:
giskard-core,giskard-llm(프로바이더에 의존하지 않는 라우팅),giskard-agents(오케스트레이션)는 기반 인프라를 제공합니다.
대상 사용자
LLM 기반 에이전트, RAG 파이프라인, 다단계 AI 워크플로우를 구축하는 개발자 및 AI 엔지니어로, 배포 전에 시스템의 견고성, 안전성, 신뢰성을 보장하고자 하는 분들입니다.
주요 특징
- LLM-as-Judge: LLM을 사용하여 에이전트 응답의 품질과 근거성을 평가합니다.
- 자동 레드팀 활동: 적대적 입력을 자동으로 생성하여 취약점과 프롬프트 인젝션을 탐지합니다.
- 모듈형 아키텍처: 가벼운 패키지로, 동기/비동기 호출 가능한 어떤 함수도 타겟으로 감쌀 수 있습니다.
- RAG 평가: 지식 기반의 품질과 근거성 평가를 위한 전용 도구를 제공합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트