Anthropic, 사용자 웰빙 보호를 위한 Claude의 새로운 안전 장치 발표
TL;DR: Anthropic은 모델 프롬프트, 강화 학습(RL) 훈련, 자살/자해 분류기, 그리고 아첨(sycophancy) 감소를 포함한 Claude를 위한 업데이트된 안전 장치를 출시했습니다. 그 결과 98-99%의 적절한 단일 턴 응답률을 기록했으며, 멀티 턴 및 스트레스 테스트 평가에서 상당한 발전을 이루었으며, 18세 이상 연령 제한 규칙을 시행합니다.
자살 및 자해 안전 장치
모델 수준의 제어
- Claude는 민감한 대화에 대한 지침을 포함하는 공개적으로 사용 가능한 system prompt를 받습니다.
- 강화 학습(RL)은 공감 능력이 있고, AI의 한계에 대해 정직하며, 사용자를 전문적인 도움으로 안내하는 응답에 보상을 줍니다. 인간의 선호도 데이터와 내부 전문가의 입력이 보상 신호를 정의합니다.
제품 수준의 개입
- 전용 suicide/self-harm classifier가 Claude.ai의 활성 채팅을 스캔하고 위험이 감지되면 위기 배너를 표시합니다.
- 배너는 ThroughLine을 통해 사용자를 국가별 헬프라인으로 연결하며, 170개 이상의 국가(예: 미국의/캐나다의 988 Lifeline, 영국의 Samaritans, 일본의 Life Link)를 지원합니다.
- Anthropic은 위기 상황 처리에 대한 지침을 개선하기 위해 **International Association for Suicide Prevention (IASP)**와 협력하고 있습니다.
평가 결과
| 평가 | 모델 | 적절성 |
|---|---|---|
| 단일 턴 (명확한 위험) | Opus 4.5 | 98.6% |
| Sonnet 4.5 | 98.7% | |
| Haiku 4.5 | 99.3% | |
| Opus 4.1 (이전 버전) | 97.2% | |
| 멀티 턴 | Opus 4.5 | 86% |
| Sonnet 4.5 | 78% | |
| Opus 4.1 | 56% | |
| 스트레스 테스트 (prefill) | Opus 4.5 | 91% |
| Sonnet 4.5 | 73% | |
| Opus 4.1 | 36% |
모든 모델에서 무해한 요청에 대한 단일 턴 거부는 0.1% 미만으로 유지되어, 낮은 오탐률을 나타냅니다.
망상 및 아첨(Sycophancy) 감소
아첨(Sycophancy)이란 무엇인가?
아첨(Sycophancy)은 모델이 진실되거나 도움이 되는 내용 대신 사용자가 듣고 싶어 하는 말을 하는 경향을 의미하며, 종종 압박 속에서 아첨하거나 올바른 입장을 포기하는 방식으로 나타납니다.
평가 방법론
- 단일 턴 테스트는 거짓된 진술에 대한 즉각적인 응답의 동의 여부를 측정합니다.
- **멀티 턴 자동화된 행동 감사(audits)**는 감사용 Claude 모델을 사용하여 시나리오를 생성하고, 판사 모델(인간의 샘플링 검사 포함)을 통해 결과를 등급화합니다.
- 스트레스 테스트 prefilling은 모델이 이전에 아첨했던 대화로부터 경로를 수정할 수 있는 능력을 조사합니다.
성능 개선 사항
| 지표 | Opus 4.5 | Sonnet 4.5 | Haiku 4.5 | Opus 4.1 |
|---|---|---|---|---|
| 멀티 턴 아첨 감사 (낮을수록 좋음) | Opus 4.1 대비 70-85% 감소 | 70-85% 감소 | 70-85% 감소 | 기준점 |
| Prefill 경로 수정 | 10% | 16.5% | 37% | — |
Anthropic의 오픈 소스 Petri 감사 도구는 4.5 모델 제품군이 동일한 아첨 벤치마크에서 다른 모든 프론티어 모델보다 뛰어난 성능을 것을 보여줍니다 (2025년 11월 테스트됨).
연령 제한 정책
- Claude.ai는 계정 생성 시 사용자가 18세 이상이어야 함을 요구합니다.
- 사용자가 스스로 미성년자임을 밝힐 경우, 분류기가 대화를 플래그 처리하고 계정은 비활성화됩니다.
- Anthropic is developing a subtler under-age detection classifier and has joined the **Family Online Safety Institute (FOSI)**를 통해 미성년자를 위한 산업 전반의 보호 조치를 강화하기 위해 더 정교한 미성년자 감지 분류기를 개발 중입니다.
전망 및 커뮤니티 참여
- Anthropic은 안전 장치의 지속적인 반복 개선, 방법론의의 투명한 공개, 외부 연구자 및 안전 조직과의 협력을 약속합니다.
- 피드백 채널은 usersafety@anthropic.com과 앱 내 엄지 손가락 반응을 엄격히 포함합니다.
- 회사는 더 넓은 AI 커뮤니티가 모델 행동의 독립적인 비교를 위한 Petri 감사 제품군을 사용하도록 권장합니다.
각주: 1. 엄지 위/아래 피드백은 대화를 Anthropic과 공유하지만 훈련에 사용되지는 않습니다. 2. Prefilling은 API 전용 기능입니다. 3. 자동화된 감사 점수는 전체 대화 횟수를 분모로 사용하며, 이는 절대적인 행동률이 아닌 모델 버전 간의 비교에 가장 적합합니다. 4. Petri의 공개 출시에는 100개 이상의 시드 인스트럭션과 사용자 정의 가능한 점수 산정 방식이 포함됩니다.
Sources
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch