AprielGuard: 현대 LLM 시스템에서 안전 및 적대적 견고성을 위한 가드레일
Hugging Face와 ServiceNow AI는 AprielGuard라는 8B 파라미터 보호 모델을 소개했습니다. 이 모델은 16가지 안전 위험 카테고리와 다양한 적대적 공격을 탐지하도록 설계되었으며, 독립 프롬프트, 다중 턴 대화, 에이전시 워크플로우 전반을 지원합니다. 전통적인 안전 분류기의 한계를 극복하고 다중 턴 대화, 긴 컨텍스트, 복잡한 에이전시 워크플로우를 지원함으로써 부서진 방어 시스템의 필요성을 줄입니다.
통합 안전 및 적대적 탐지
AprielGuard는 안전 위험 분류와 적대적 공격 탐지를 위한 단일 인터페이스를 제공합니다. 독립 프롬프트, 다중 턴 대화, 에이전시 워크플로우(도구 호출, 추론 트레이스, 메모리, 시스템 컨텍스트 포함)라는 세 가지 주요 입력 형식에서 작동합니다.
안전 분류 체계
SALAD-Bench에서 영감을 받아 모델은 안전 위험을 16개의 구별된 카테고리로 분류합니다:
- O1-O3: 유해 콘텐츠, 불공정한 표현, 성인 콘텐츠
- O4-O5: 공공 정보에 대한 신뢰 침식, 오해/거짓 믿음 전파
- O6-O8: 위험한 금융 관행, 무역 및 규정 준수, 위험한 정보 유포
- O9-O11: 프라이버시 침해, 보안 위협, 명예 훼손
- O12-O14: 사기 또는 기만 행위, 영향력 작전, 불법 활동
- O15-O16: 설득 및 조작, 개인 재산 침해
적대적 공격 탐지
AprielGuard는 프롬프트 인젝션, 탈옥, 사고 흐름 손상, 컨텍스트 하이재킹, 메모리 중독, 다중 에이전트 악용 시퀀스 등 안전 메커니즘을 회피하도록 설계된 다양한 적대적 패턴을 탐지합니다. 모델은 이러한 위협에 대해 이진 분류(적대적 vs. 비적대적)를 제공합니다.
기술 아키텍처 및 학습
AprielGuard는 Apriel-1.5 Thinker Base 변형의 축소된 8B 파라미터 버전을 기반으로 하며, 인과 디코더 전용 트랜스포머 아키텍처를 활용합니다.
이중 모드 작동
지연 시간과 해석 가능성 사이의 균형을 맞추기 위해 모델은 두 가지 모드를 제공합니다:
- Reasoning Mode: 분류 결정에 대한 구조화된 설명을 생성하여 설명 가능성을 제공합니다.
- Fast Mode: 저지연 프로덕션 파이프라인을 위해 분류만 제공합니다.
학습 방법론
모델은 bfloat16 정밀도를 사용하여 최대 32k 토큰의 시퀀스 길이로 3 epoch 동안 학습되었습니다. 학습 데이터셋은 여러 특수 소스를 활용하여 구성되었습니다:
- Synthetic Data: Mixtral-8x7B 및 검열되지 않은 모델을 사용해 생성했으며, 다중 턴 대화 데이터셋을 위해 SyGra 프레임워크와 NVIDIA NeMo Curator를 활용했습니다.
- Data Augmentation: 문자 수준 노이즈, 오타, 리트스피크, 구문 재배열을 포함하여 비표준 텍스트에 대한 회복력을 향상시켰습니다.
- Agentic Workflows: 계획, 도구 호출 및 실행 추적을 포함한 시뮬레이션 시나리오로, 특정 구간(예: 도구 출력 또는 메모리 상태)을 손상시켜 공격 벡터를 모의했습니다.
- Long Context: RAG 워크플로우와 운영 보고서를 포함한 특수 데이터셋으로, 최대 32k 토큰까지 "바늘 찾기" 위험 탐지를 테스트했습니다.
성능 및 평가
AprielGuard는 공개 벤치마크, 내부 에이전시 벤치마크, 다국어 데이터셋을 통해 평가되었습니다.
안전 및 적대적 벤치마크
공개 안전 벤치마크에서 모델은 HarmBench (1.00), SimpleSafetyTests (0.98), XSTest (0.94)와 같은 데이터셋에서 높은 F1 점수를 기록했습니다. 적대적 탐지에서는 ChatGPT-Jailbreak-Prompts (1.00 F1)와 Salad-Data (0.98 F1)에서 강력한 성능을 보였으나, prompt-injections (0.68 F1)와 같은 특정 프롬프트 인젝션 벤치마크에서는 성능 차이가 있었습니다.
장기 컨텍스트 및 다국어 견고성
장기 컨텍스트 평가(최대 32k 토큰)에서 AprielGuard는 높은 정밀도와 재현율을 유지했습니다. 안전 위험에 대해 비추론 모드는 F1 0.97, 추론 모드는 0.95를 달성했습니다. 적대적 공격에 대해서는 추론 모드가 F1 0.94로 비추론 모드의 0.88보다 향상되었습니다.
다국어 능력은 프랑스어, 프랑스어(캐나다), 독일어, 일본어, 네덜란드어, 스페인어, 포르투갈어(브라질), 이탈리아어 등 8개 언어에 대해 MADLAD400-3B-MT 모델의 번역을 사용해 테스트했으며, 이러한 언어 환경에서도 합리적인 성능을 보였습니다.
제한 사항 및 배포 고려사항
AprielGuard가 통합된 보호 기능을 제공하지만, 개발자는 몇 가지 제한 사항을 언급합니다:
- Domain Sensitivity: 법률이나 의료와 같은 고도로 전문화된 기술 분야에서 모델 성능이 저하될 수 있습니다.
- Latency Trade-off: Reasoning 모드가 계산 비용과 지연 시간을 증가시킵니다.
- Consistency: Reasoning 활성화 모드와 비활성화 모드 간에 분류 결과에 가끔 일관성 문제가 발생합니다.
- Language Coverage: 비영어 8개 언어에 대해 테스트했지만, 비영어 환경에서 프로덕션에 배포하기 전에 충분한 보정이 권장됩니다.