오픈 LLM을 활용한 헌법 AI
Hugging Face는 오픈 소스 대형 언어 모델을 사용하여 헌법적 AI(CAI)를 구현하기 위한 포괄적인 레시피와 새로운 도구 llm-swarm를 출시했습니다. 이 접근 방식은 AI가 정의된 "헌법" 원칙에 따라 자체 출력물을 비판하고 수정하도록 함으로써 개발자가 모델을 특정 가치와 안전 가드레일에 맞추도록 할 수 있으며, 비용이 많이 드는 인간 라벨링 선호 데이터의 필요성을 없앱니다.
헌법적 AI(CAI) 프로세스
헌법적 AI는 모델이 자체적으로 정렬되도록 3단계 반복 프로세스를 따라 바람직하지 않은 응답을 안전하고 정렬된 응답으로 변환합니다:
- Initial Response: 모델은 잠재적으로 해롭거나 바람직하지 않은 질문(예: "How to steal an iPhone?")에 대한 프롬프트를 받습니다.
- Self-Critique: 모델은 헌법 원칙 집합에 근거해 자체 출력물을 비판하도록 요청받습니다(예: "응답이 불법이거나 위험할 수 있는지 논의하십시오").
- Revision: 모델은 해로운 내용을 제거하고 헌법에 맞게 응답을 다시 작성합니다.
이 프로세스는 추가 학습을 위해 두 종류의 합성 데이터셋을 생성합니다:
- Supervised Fine-Tuning (SFT) Dataset: 초기 프롬프트와 최종 수정된 응답의 쌍.
- Preference Dataset: 수정된 응답(선호)과 초기 바람직하지 않은 응답(거부)의 쌍.
llm-swarm를 활용한 스케일 가능한 합성 데이터 생성
CAI에 필요한 수만 개의 합성 응답을 생성하기 위해 Hugging Face는 llm-swarm를 도입했습니다. 이 도구는 Slurm 클러스터에서 분산 생성하도록 설계되었으며 TGI(Text Generation Inference)와 vLLM으로 구동됩니다.
llm-swarm의 주요 기능:
- Automated Endpoint Management:
sbatch를 통해 추론 인스턴스를 자동으로 시작하고 작업이 완료되면 종료하여 GPU 낭비를 방지합니다. - Load Balancing: nginx 도커 컨테이너를 활용해 여러 엔드포인트에 요청을 "least connection" 전략으로 분산시켜 높은 확장성을 보장합니다.
기술 구현 및 모델 성능
구현을 위해 Hugging Face는 mistralai/Mistral-7B-Instruct-v0.1를 시작점으로 사용했으며, 이는 강력한 지시 수행 능력과 내재된 가드레일이 없기 때문입니다. 그들은 Anthropic의 HH 선호 데이터셋을 레드팀 프롬프트에 활용하고, 결과 CAI 데이터셋을 Ultrachat 데이터셋과 혼합하여 전반적인 유용성을 유지했습니다.
Helpfulness and the "Alignment Tax"
MT Bench를 사용한 평가 결과, CAI 데이터셋으로 학습한다고 해서 반드시 모델 유용성이 감소하는 것은 아니었습니다. 경우에 따라 CAI 데이터를 추가하면 MT Bench 점수가 오히려 상승했습니다. 예를 들어, cai-conversation-harmless 데이터셋의 15%(약 32k 예시)를 추가하면 SFT 모델 점수가 ~6.25에서 ~6.38로 증가했습니다.
Safety and Robustness
10개의 레드팀 프롬프트와 "DAN"(Do Anything Now) 탈옥 프롬프트를 사용해 CAI 모델과 기본 SFT+DPO 모델을 비교한 결과, 견고성에서 상당한 개선이 나타났습니다:
| 방법 / 프롬프트 방법 | 프롬프트 없음 | 안전 시스템 프롬프트 | DAN 프롬프트 | 안전 시스템 프롬프트 + DAN 프롬프트 |
|---|---|---|---|---|
| CAI (SFT + DPO) | 10/10 | 10/10 | 5/10 | 7/10 |
| CAI (SFT only) | 10/10 | 10/10 | 5/10 | 7/10 |
| Baseline (SFT + DPO) | 5/10 | 4/10 | 1/10 | 1/10 |
결과는 안전 시스템 프롬프트만으로는 탈옥에 거의 효과가 없으며, CAI로 학습된 모델이 프롬프트 주입에 훨씬 더 탄력적임을 보여줍니다.
정렬 스타일의 유연성
CAI는 정의된 헌법에 의존하기 때문에 안전 가드레일의 "성격"을 맞춤화할 수 있습니다. Hugging Face는 표준적인 정중한 거절 대신 풍자와 유머를 사용해 해로운 요청을 거부하는 "Grok 스타일" 모델을 만들어 이를 시연했습니다.
헌법을 조정해 무감각함에 대한 풍자적 지적이나 범죄 계획에 대한 유머러스한 거절을 요청함으로써 grok-conversation-harmless 데이터셋을 생성했습니다. 테스트 결과, Grok 스타일 CAI 모델(SFT+DPO)은 여러 프롬프트 방법에서 10/10의 안전 성공률을 달성했으며, DAN 프롬프트에 대해서도 9/10을 기록해 기본 모델보다 우수했습니다.
사용 가능한 리소스
- Tooling:
llm-swarmGitHub 저장소 - Datasets:
cai-conversation-harmless(Anthropic 기반) 및grok-conversation-harmless(Grok 스타일) 데이터셋. - Models:
mistral-7b-anthropic(DPO) 및mistral-7b-grok(SFT) 모델. - Recipe: alignment-handbook의 Constitutional AI 레시피.
Sources
- OriginalConstitutional AI with Open LLMs