NVIDIA/garak
the LLM vulnerability scanner
해결하는 문제
garak는 대규모 언어 모델(LLM)의 보안 취약점과 오류 상태를 식별하기 위해 설계된 취약점 스캐너입니다. 개발자와 연구자들이 모델이 원치 않는 출력(예: 환각, 데이터 유출, 독성, 오해의 소지 있는 정보 등)을 생성하도록 조작되는지 여부를 모델을 배포하기 전에 확인할 수 있도록 도와줍니다.
작동 방식
이 도구는 정적, 동적, 적응형 기법의 조합을 사용하여 LLM을 탐색하는 레드팀 키트로 작동합니다. 다음과 같은 모듈식 아키텍처로 구성되어 있습니다:
- 프로브: 특정 상호작용이나 공격 벡터를 생성하는 모듈 (예: 프롬프트 인젝션, DAN과 같은 절차적 탈출, 인코딩 기반 공격).
- 생성기: 타겟 LLM에 연결하는 플러그인으로, 허깅페이스, 오픈AI, AWS Bedrock, REST 엔드포인트 등 다양한 인터페이스를 지원합니다.
- 감지기: 모델의 응답을 분석하여 프로브가 성공적으로 실패를 유도했는지 판단하는 모듈입니다.
- 하네스: 테스트 프로세스를 구조화하고 프로브와 감지기 간의 흐름을 관리하는 시스템입니다.
대상 사용자
AI 보안 연구자, 레드팀원, LLM 개발자에게 적합합니다. 기존의 알려진 취약점과 안전성 리스크를 자동으로 스캔할 필요가 있는 분들께 이상적입니다.
주요 특징
- 광범위한 모델 지원: 허깅페이스, 오픈AI, Replicate, Groq, AWS Bedrock, GGUF와 같은 로컬 형식을 포함해 다양한 모델과 호환됩니다.
- 풍부한 프로브 라이브러리: 프롬프트 인젝션, 악성코드 생성, XSS, "글리치 토큰" 전용 프로브를 포함합니다.
- 자동 평가: 명확한 실패율과 각 탐색 시도에 대한 상세한 JSONL 로그를 제공합니다.
- 확장성 있는 설계: 사용자가 쉽게 자체 프로브, 감지기, 생성기를 만들고 통합할 수 있도록 설계되어 있습니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- Dispatch