meta-llama/PurpleLlama

Set of tools to assess and improve LLM security.

해결하는 문제

Purple Llama는 오픈형 생성형 AI 모델을 책임감 있게 개발하고 사용할 수 있도록 커뮤니티를 지원하기 위해 설계된 통합 프로젝트입니다. LLM과 관련된 위험, 특히 사이버보안 위협, 악의적인 프롬프트, 그리고 불안전한 코드 생성 문제를 해결하기 위해 위험을 완화할 수 있는 도구와 평가 시스템을 제공합니다.

작동 방식

이 프로젝트는 공격(레드팀)과 방어(블루팀) 전략을 결합한 '퍼플 팀' 접근 방식을 사용합니다. 주로 다음 세 가지 유형의 도구를 제공합니다:

  • 시스템 수준의 보안 장치: Llama Guard (위반 콘텐츠를 탐지하는 모더레이션 모델 시리즈), Prompt Guard (프롬프트 인젝션 및 재설정 시도를 방지), Code Shield (추론 시점에서 LLM이 생성한 불안전한 코드를 필터링)
  • 평가 및 벤치마크: CyberSec Eval 시리즈(v1, v2, v3)는 산업 표준 벤치마크를 제공하여 사이버보안 위험을 정량화하고, 코드 인터프리터의 악용 가능성을 측정하며, 시각적 프롬프트 인젝션 및 스피어 피싱 능력을 테스트합니다.

대상 사용자

오픈형 생성형 AI 모델을 배포하고, 신뢰성, 안전성, 보안 계층을 구현하여 애플리케이션이 안전하고 콘텐츠 가이드라인에 부합하도록 보장해야 하는 개발자 및 연구자.

주요 특징

  • Llama Guard 3: 다국어 지원, 128k 컨텍스트 창, 이미지 추론 기능을 갖춘 고성능 모더레이션 모델
  • Prompt Guard: 프롬프트 인젝션 및 재설정 시도를 탐지하고 차단하는 전용 도구
  • Code Shield: 추론 시점에서 불안전한 코드 실행이나 코드 인터프리터의 악용을 방지하는 필터링 기능
  • CyberSec Eval: CWE 및 MITRE ATT&CK와 같은 산업 표준을 기반으로 한 LLM의 사이버보안 위험을 평가하는 포괄적인 벤치마크 세트

관련

  • 프로젝트
  • Dispatch
  • 프로젝트
  • 프로젝트
  • Dispatch