대형 언어 모델 레드팀
레드팀은 LLM 취약점 식별에 필수적입니다
레드팀은 모델 취약점을 이끌어내어 허위 정보, 편향, 증오, 유해 콘텐츠 생성 또는 개인 정보 노출과 같은 바람직하지 않은 행동을 초래할 수 있는 평가 형태입니다. 대형 언어 모델(LLM)은 방대한 데이터셋으로 학습되기 때문에 이러한 행동을 보일 수 있으며, 해로운 결과를 방지하기 위해 모델을 유해한 결과에서 벗어나게 하는 전략을 개발함으로써 완화할 수 있습니다.
레드팀과 적대적 공격 구분
- Adversarial Attacks: 종종 이해할 수 없는 문자열(예: 프롬프트에 "aaabbbcc"를 앞에 붙이는 경우)을 사용하여 모델 성능을 저하시킵니다.
- Red-Teaming: 일반적인 자연어와 유사한 프롬프트를 사용하여 실제 사용자 상호작용을 더 잘 대표합니다.
가드레일 우회 및 탈옥 기술
LLM이 안전 가드레일을 벗어나도록 조작될 때 탈옥이 발생합니다. 안전 및 정렬을 위해 미세조정된 모델(RLHF 또는 SFT 사용 등)을 우회하기 위해 레드팀은 창의적인 전략을 사용합니다:
- Roleplay Attacks: LLM에게 악의적인 캐릭터처럼 행동하도록 지시합니다.
- Code-based Prompts: 모델이 학습된 편향을 드러내기 위해 자연어 대신 코드로 응답하도록 지시합니다.
- Human-in-the-loop vs. LM-based testing: 레드팀은 인간이 수행하거나 다른 언어 모델이 대상 LM의 유해 출력을 테스트하는 방식으로 수행될 수 있습니다.
유용성 및 무해성 사이의 긴장
모델이 유용함(지시를 따르는)과 무해함(해를 초래하는 것을 방지하는) 사이에는 본질적인 트레이드오프가 존재합니다. 공격적인 생성물을 방지하기 위한 일반적인 우회 방법은 프롬프트가 잠재적으로 공격적인지 예측하는 분류기를 사용하고 미리 정의된 응답을 제공하는 것입니다. 그러나 이 접근법은 모델이 과도하게 회피적으로 변하게 하여 유용성을 감소시킵니다.
중요한 위협 시나리오와 새로운 능력
LLM이 명시적으로 학습되지 않은 새로운 능력(행동)을 얻게 되면서, "중요한 위협 시나리오"를 시뮬레이션하는 것이 중요해집니다. 여기에는 다음이 포함됩니다:
- Power-seeking behavior: 모델이 자원을 추구하는 시나리오를 시뮬레이션합니다.
- Persuasion: 사람들에게 자신이나 타인에게 해를 끼치도록 설득하려는 시도.
- Physical outcomes: 모델이 API를 통해 화학 물질을 온라인으로 주문하는 등 물리적 결과를 초래할 수 있는 시나리오.
LLM 레드팀 연구의 주요 발견
Anthropic의 연구(Ganguli et al. 2022 및 Perez et al. 2022)를 기반으로 여러 주요 발견이 도출되었습니다:
- Alignment does not prevent red-teaming: 유용하고 정직하며 무해한 행동을 가진 few-shot 프롬프트 LMs는 일반 LMs보다 레드팀하기 더 어렵지 않습니다.
- Scaling effects: 모델 크기와 공격 성공률 사이에 명확한 경향이 없으며, RLHF 모델은 규모가 커질수록 레드팀하기 더 어려워집니다.
- Evasiveness: 모델은 회피적으로 변함으로써 무해해지는 방법을 학습할 수 있으며, 이는 유용성과의 트레이드오프를 만듭니다.
- Human disagreement: 무엇이 성공적인 공격인지에 대해 인간들 사이에 일반적으로 낮은 합의가 있습니다.
- Harm categories: 비폭력적인 해악 카테고리가 공격 성공률이 더 높습니다.
- Crowdsourcing limitations: 크라우드소싱된 레드팀은 종종 중복되고 "템플릿 같은" 프롬프트를 생성합니다.
향후 방향 및 오픈소스 리소스
레드팀은 LLM 워크플로우에서 아직 충분히 탐구되지 않은 영역입니다. 향후 우선순위는 코드 생성 탈옥을 위한 오픈소스 데이터셋(예: DDOS 또는 백도어 공격용 프로그램 생성) 제작과 회피성 및 유용성 사이의 트레이드오프를 위한 파레토 프론트 탐색을 포함합니다.
사용 가능한 오픈소스 데이터셋
- Meta: Bot Adversarial Dialog dataset
- Anthropic: Red-teaming attempts
- AI2: RealToxicityPrompts
SUMMARY: Hugging Face는 유해한 출력을 방지하기 위해 LLM 취약점을 식별하는 데 있어 레드팀의 중요한 역할을 강조하며, 협업적이고 적응적인 평가 방법의 필요성을 강조합니다.
TITLE: 대형 언어 모델 레드팀