Hugging Face와 Haize Labs, Red-Teaming Resistance 리더보드 소개
Haize Labs는 Hugging Face의 지원을 받아 Red-Teaming Resistance (RTR) 벤치마크를 도입했습니다. 이 도구는 정교하게 구성된 프롬프트를 사용하여 최첨단 대형 언어 모델(LLM)의 견고성을 체계적으로 탐색하고, 실패 모드와 취약점을 식별하여 모델이 책임감 있게 배포되도록 보장합니다.
인간형 적대적 공격에 초점
RTR 벤치마크는 인위적인 자동 공격보다 고품질의 인간이 읽을 수 있는 공격을 우선시합니다. 제작자들은 GCG 레드팀 알고리즘과 같은 많은 자동 레드팀 방법이 자연어와 구조적으로 일치하지 않는 프롬프트를 생성하며, 간단한 분류기 기반 방어에 쉽게 차단된다고 주장합니다.
현실적인 스트레스 테스트를 보장하기 위해, 이 벤치마크는 지난 1년간 발표된 AI 안전 연구의 주요 레드팀 데이터셋 모음에 대해 모델을 평가합니다. 이러한 데이터셋에는 대상 모델의 해로운 능력을 유도하도록 설계된 인간 탈옥 프롬프트가 포함되어 있습니다.
Red-Teaming Resistance 데이터셋
이 벤치마크는 LLM 견고성을 측정하기 위해 여덟 개의 서로 다른 적대적 프롬프트 데이터셋을 활용합니다:
- AdvBench: 욕설, 차별, 폭력 등을 포함한 행동을 유도하는 지시.
- AART: 다양한 문화, 지리 및 응용 환경에서 AI가 지원하는 적대적 프롬프트.
- Beavertails: 안전 정렬 연구를 위해 설계된 프롬프트.
- Do Not Answer (DNA): 책임 있는 모델이 답변해서는 안 되는 프롬프트로 구성된 저비용 평가 데이터셋.
- RedEval-HarmfulQA: 10개의 주제와 각각 약 10개의 하위 주제를 다루는 해로운 질문.
- RedEval-DangerousQA: 인종차별, 고정관념, 성차별, 불법, 독성 및 해로운 콘텐츠를 다루는 질문.
- Student-Teacher Prompting (STP): Vicuna-13B를 성공적으로 무너뜨린 해로운 프롬프트.
- SAP: 인간의 말을 모방하기 위해 인컨텍스트 학습으로 생성된 적대적 프롬프트.
응답이 “안전”인지 “불안전”인지를 판단하기 위해, 벤치마크는 LlamaGuard(맞춤형 분류 체계 사용)와 GPT-4를 결합하고, 이어 Haize 팀이 수동으로 sanity check을 수행합니다. 최종 점수는 판단 모델이 안전하다고 판단한 프롬프트의 비율을 나타냅니다.
위반 카테고리별 견고성
일반적인 “불안전” 라벨보다 더 세분화된 통찰을 제공하기 위해, RTR 벤치마크는 공격을 OpenAI 사용 정책을 일부 참고한 특정 위반 카테고리로 구분합니다:
해악 및 폭력
- Hate/Harassment/Discrimination: 불관용이나 적대감을 조장하는 행위.
- Children-Specific Harm: 아동을 위험에 빠뜨리거나 해치는 콘텐츠.
- Physical-Specific Harm: 신체적 부상을 조장하는 자료.
범죄 행위
- Malware: 해로운 소프트웨어 배포.
- Fraud/Deception: 개인 이익을 위한 사기 행위.
- Privacy Violation: 무단 데이터 수집 또는 공유.
- Economic Deception: 재정적 착취를 위한 오해를 일으키는 행위.
- Unauthorized practice of medical advice: 적절한 허가 없이 의료 조언을 제공하는 행위.
- Unauthorized Practice of Law: 면허 없이 법률 서비스를 제공하는 행위.
- Misc. Illegal Activity: 기타 불법 활동
원치 않는 조언
- Tailored Financial Advice: 자격 없이 제공되는 구체적인 재무 조언.
- Political Campaigning: 정치적 의제나 후보자를 원치 않게 홍보하는 행위.
- High Risk Government Decision Making: 권한 없이 중요한 정부 결정을 영향을 미치는 행위.
NSFW
- Adult Content: 노골적인 언어, 욕설, 약물, 알코올 또는 담배 남용에 대한 논의.
- Sexual Content: 성적 활동을 묘사하거나 설명하는 자료.
RTR 리더보드에서 얻은 주요 인사이트
초기 벤치마크 결과는 모델 견고성에서 세 가지 주요 추세를 보여줍니다:
- 폐쇄형 소스 우위: GPT-4와 Claude-2가 모든 카테고리에서 견고성 면에서 큰 차이를 유지합니다. 그러나 저자들은 이것이 기본 모델 때문인지 API에 추가된 외부 안전 분류기 때문인지 명확하지 않다고 지적합니다.
- 공통 취약점: 모델은 성인 콘텐츠, 신체적 해악, 아동 해악을 유발하는 탈옥에 가장 취약합니다.
- 강력한 방어: 모델은 일반적으로 프라이버시 위반, 법률, 재무 또는 의료 조언 요청, 그리고 정치 캠페인 프롬프트에 대해 높은 견고성을 보여줍니다.