confident-ai/deepteam

DeepTeam is a framework to red team LLMs and AI agents.

해결하는 문제

DeepTeam은 LLM 시스템(예: AI 에이전트, RAG 파이프라인, 챗봇 등)에 대해 구조화된 방식으로 레드팀(적대적 침투 테스트)을 수행할 수 있도록 도와줍니다. 개발자들이 본격적인 운영 환경에 도달하기 전에 보안 취약점, 안전성 리스크, 윤리적 편향을 식별하고, 실시간으로 이러한 위협을 차단할 수 있는 도구를 제공합니다.

작동 방식

DeepTeam은 model_callback를 사용해 LLM 애플리케이션을 감싸고, 동적으로 생성된 적대적 공격에 노출시킵니다. LLM-as-a-Judge 메트릭을 활용해 응답을 평가하고 이진 성공/실패 점수를 생성합니다. 이 프레임워크는 다음과 같은 기능을 지원합니다:

  • 취약점 탐지: 데이터 프라이버시, 책임 있는 AI, 보안(예: SQL 인젝션), 안전성, 에이전트 리스크 등 50개 이상의 사전 정의된 취약점 범주.
  • 적대적 공격: 단일 턴 공격(프롬프트 인젝션, Base64 인코딩, 역할극)과 다단계 대화 공격(Crescendo 및 Tree Jailbreaking)을 포함한 20개 이상의 연구 기반 방법.
  • 안전성 프레임워크: OWASP Top 10 for LLMs/Agents, NIST AI RMF, MITRE ATLAS 등 산업 표준과 즉시 매핑 가능.
  • 가드레일: 입력과 출력을 실시간으로 모니터링하여 본격적인 운영 환경에서 위반 콘텐츠를 차단하는 이진 분류기.

대상 사용자

복잡한 에이전트 시스템이나 RAG 파이프라인을 개발하는 AI 개발자 및 보안 엔지니어를 위한 것입니다. 안전성과 보안 준수를 검증해야 하는 사용자에게 적합합니다.

주요 특징

  • 풍부한 공격 라이브러리: 최신 기술인 jailbreaking 및 오브스커레이션 기법을 대량 포함.
  • 에이전트 전용 테스트: 목표 도난, 재귀적 해킹, 도구 오케스트레이션 남용 등 에이전트 고유 리스크에 특화된 취약점.
  • 프레임워크 통합: OWASP, NIST, MITRE와 같은 글로벌 AI 안전성 기준과 자동으로 일치.
  • 로컬 실행: 사용자 기기에서 로컬로 실행 가능하며, DeepEval 프레임워크 기반으로 구축됨.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트