Hugging Face: 제어 가능한 LLM 안전 거부를 위한 경계 인식 자기 분산
광범위한 주제 거부보다 정교한 안전 경계
대부분의 안전 정렬 프로세스는 해를 주는 것을 전체 주제의 성질로 간주하여, 의도와 무관하게 특정 카테고리(예: 무기 또는 사기) 내 모든 프롬프트를 거부한다. 이 접근 방식은 모델이 단지 '위험해 보이는' 단어를 포함하고 있을 뿐인 안전한 프롬프트도 거부하는 실패 모드를 초래한다. 이를 해결하기 위해 Hugging Face와 Multiverse Computing는 '좁은 경계 안전성' 접근 방식을 제안한다. 이는 모델이 주제의 해로운 부분만 거부하고, 유익한 부분은 계속 답변할 수 있도록 한다.
좁은 경계 안전성 프레임워크
좁은 경계 안전성은 주제 전체가 해로운 부분과 유익한 보완 부분으로 나뉘는 문제로 정의한다. 목표는 모델 행동에 '예리한 단계'를 만드는 것이다: 해로운 부분 내에서는 즉각적으로 거부하고, 주제 내 다른 모든 곳에서는 유용하게 행동한다.
표준 크로스 엔트로피 학습은 종종 거부 확률을 유익한 영역으로 밀어내기 때문에, 연구팀은 프롬프트 쌍을 사용하여 경계를 구체화했다. 이러한 쌍은 주제의 핵심을 공유하지만 의도는 다르다—하나는 거부되도록 설계되었고, 다른 하나는 답변되도록 설계되었다. 이 연구의 테스트베드로 정치적 설득을 사용한 이유는, 조작적 설득(해로운)과 사실 기반 정치 정보(유익한) 사이에 명확한 구분이 가능하기 때문이다.
자기 생성 안전 조정의 실패 해결
표준 자기 생성 파이프라인—모델을 거부로 유도하고, 게이트 모델이 결과를 검증하는 방식—은 좁은 경계에 적용할 때 세 가지 주요 약점이 있다.
1. 커버리지 갭
단일 시도 유도는 종종 수용 가능한 거부를 생성하지 못해 어려운 프롬프트가 조용히 제거된다. 감사된 풀에서 단일 시도 생성은 19.88%의 프롬프트(8,009개 예시)를 손실했다. 연구팀은 점진적으로 강화된 유도를 사용하는 증가형 재시도 전략을 구현하여 잔여 실패율을 0.20%(79개 프롬프트)로 줄였고, 해로운 학습 데이터를 40,293개로 증가시켰다.
2. 부정적 반응
안전 조정은 종종 겉보기에는 위험해 보이는 유익한 프롬프트에서 잘못된 거부를 유발한다. 이를 완화하기 위해 연구팀은 18개의 의미 유형에 걸쳐 11,955개의 검증된 겉보기 위험한 유익한 프롬프트를 학습 데이터에 포함시켜, 모델이 학습 중에 위험한 표현을 가진 안전한 프롬프트를 경험하도록 했다.
3. 경계 측정 실패
표준 해로운-유익한 분할은 실제 경계의 모양을 측정하지 못한다. 모델이 허용 가능한 프롬프트 영역까지 거부 영역을 확장함으로써 단순히 '더 안전해 보일' 수 있다. 이를 해결하기 위해 연구팀은 보류된 해로운-유익한 쌍(각각 1,539개)을 사용하여 경계의 양쪽을 직접 측정했다.
안전성과 과도한 거부 사이의 트레이드오프
Qwen3-8B에서의 테스트 결과, 강화된 커버리지 학습은 분포 내 정치적 거부율을 9.47%에서 84.75%로 크게 높였고, HarmBench와 WildJailbreak와 같은 벤치마크에서 안전하지 않은 응답률을 26.26%에서 0.14%로 감소시켰지만, 과도한 거부를 극적으로 증가시켰다. XSTest에서 가장 강력한 구성에서는 과도한 거부율이 2.00%에서 74.00%로 상승했다.
안전성을 희생하지 않고 이를 수정하기 위해 연구팀은 두 가지 효과적인 데이터 구성 요소를 발견했다:
- 자기 생성 응답: 외부 준수 응답을 대상 모델이 생성한 검증된 응답으로 교체하면 XSTest의 과도한 거부율이 15.20%에서 5.20%로 감소했다.
- 경계 쌍: 유익한 경계 데이터를 추가하면 보류된 쌍의 준수 가능 측면에서의 과도한 거부율이 32.94%에서 4.16%로 감소했고, 해로운 측면의 거부율은 91.88%에서 87.72%로 약간 감소했다.
LLM 배포에 대한 함의
이 연구는 안전 조정이 해로운 거부율만으로 측정되어서는 안 된다는 점을 시사한다. 더 많이 거부하는 모델이 반드시 더 안전한 것은 아니다. 오히려 합법적인 프롬프트까지 거부함으로써 유용성이 떨어지고 있을 수 있다. 안전성과 과도한 거부 사이의 트레이드오프를 제어하기 위해서는 특정한 데이터 구성, 커버리지 복구, 분포 내 보정, 그리고 평가를 위한 경계 쌍의 사용이 필요하다.