Llama Guard 4 및 Llama Prompt Guard 2 출시

Meta는 12B 멀티모달 안전 모델인 Llama Guard 4와 프롬프트 인젝션 및 탈옥을 감지하기 위한 일련의 분류기인 Llama Prompt Guard 2를 출시했습니다. 이러한 도구를 통해 개발자는 사용자 입력과 모델 출력 모두를 필터링하여 프로덕션 환경에서 안전하지 않은 콘텐츠 생성을 방지할 수 있습니다.

Llama Guard 4: 멀티모달 안전 중재

Llama Guard 4는 텍스트와 이미지 모두에서 부적절한 콘텐츠를 감지하도록 설계된 12B 파라미터의 밀집 모델입니다. 24GB VRAM을 갖춘 단일 GPU에 배포할 수 있어 프로덕션 중재 파이프라인에 실용적인 선택이 됩니다. 이 모델은 텍스트 전용 입력과 이미지+텍스트 입력을 평가할 수 있어, 프롬프트가 주요 LLM에 도달하기 전에 필터링하고 어시스턴트 응답이 사용자에게 전달되기 전에 검토할 수 있습니다.

기술 아키텍처 및 훈련

Llama Guard 4는 밀집 피드포워드 조기 융합(early-fusion) 아키텍처를 활용합니다. 이는 Mixture-of-Experts(MoE) 아키텍처를 사용하는 Llama 4 Scout 모델을 프루닝하여 만들었습니다. 모든 라우팅 전문가와 라우터 레이어를 제거하고 공유 전문가만 남김으로써, Meta는 추가 사전 훈련 없이 사전 학습된 공유 전문가 가중치로 초기화된 밀집 모델을 개발했습니다.

Llama Guard 4의 훈련 데이터는 텍스트 전용 데이터와 멀티모달 데이터가 3:1 비율을 이루며, 다중 이미지 훈련 데이터(최대 5장)와 이전에 Llama Guard 3에 사용된 인간 주석 다국어 데이터를 포함합니다.

위험 분류 및 맞춤 설정

Llama Guard 4는 MLCommons 위험 분류 체계에서 정의한 14가지 위험 유형과 코드 인터프리터 남용을 기준으로 콘텐츠를 분류합니다. 지원되는 카테고리는 다음과 같습니다:

  • S1: 폭력 범죄
  • S2: 비폭력 범죄
  • S3: 성 관련 범죄
  • S4: 아동 성 착취
  • S5: 명예 훼손
  • S6: 전문적 조언
  • S7: 프라이버시
  • S8: 지적 재산권
  • S9: 무차별 무기
  • S10: 혐오
  • S11: 자살 및 자해
  • S12: 성적 콘텐츠
  • S13: 선거
  • S14: 코드 인터프리터 남용(텍스트 전용)

사용자는 채팅 템플릿을 통해 특정 카테고리 키를 제외함으로써(excluded_category_keys=["S9", "S2", "S1"]와 같이) 추론 시 감지할 카테고리 목록을 구성할 수 있습니다.

성능 벤치마크

Llama Guard 3에 비해 Llama Guard 4는 여러 영역에서 개선을 보이며, 특히 다중 이미지와 영어 텍스트 성능에서 향상이 두드러집니다:

카테고리 재현율 위양성 비율 F1-점수 Δ 재현율 Δ 위양성 비율 Δ F1-점수
영어 69% 11% 61% +4% -3% +8%
다국어 43% 3% 51% -2% -1% 0%
단일 이미지 41% 9% 38% +10% 0% +8%
다중 이미지 61% 9% 52% +20% -1% +17%

Llama Prompt Guard 2: 인젝션 및 탈옥 감지

Llama Prompt Guard 2는 86M와 22M 파라미터를 가진 두 개의 새로운 분류기로 구성됩니다. 이 모델들은 프롬프트 인젝션 및 탈옥을 감지하는 데 특화되어 있습니다.

Llama Prompt Guard 1에 비해 주요 개선 사항은 다음과 같습니다:

  • 향상된 성능: 감지 능력 향상.
  • 효율성: 새롭고 더 빠르며 더 컴팩트한 22M 파라미터 모델.
  • 탄력성: 적대적 공격에 더 강한 토크나이제이션.
  • 단순화된 분류: 이진 분류 시스템(양성 vs. 악성).

구현 및 배포

이 모델을 사용하려면 사용자는 hf_xettransformers 라이브러리의 프리뷰 릴리스(v4.51.3-LlamaGuard-preview)를 설치해야 합니다.

Llama Guard 4Llama4ForConditionalGenerationAutoProcessor를 사용하여 구현할 수 있으며, Llama Prompt Guard 2는 Hugging Face pipeline API 또는 AutoModelForSequenceClassification API를 통해 배포할 수 있습니다.

Sources