의사결정 정렬: 추론이 더 안전한 언어 모델을 가능하게 함
개요
의사결정 정렬은 안전 사양의 텍스트를 추론 모델에 가르치고 답변하기 전에 이러한 사양에 대해 추론하도록 훈련하여 더 안전하고 적절하게 보정된 응답을 생성합니다.
방법
이 접근 방식은 먼저 안전 데이터 없이 유용성을 위해 o‑스타일 모델을 훈련한 후, 시스템 프롬프트에 삽입된 관련 안전 사양 텍스트를 참조하는 사고사슬 completions을 포함하는 지도 미세 조정 데이터셋을 구축하고, 정책 인식 보상 모델로 데이터를 필터링한 후, 동일한 보상 모델을 사용한 강화 학습을 통해 안전 추론을 위한 사고사슬 사용을 개선합니다.
결과
o1 모델은 GPT‑4o 및 기타 최첨단 LLM과 비교하여 과소 및 과다 거부에 대해 파레토 개선을 달성하고, StrongREJECT 및 XSTest와 같은 많은 내부 및 외부 안전 벤치마크를 포화시키며, 분포 외 안전 시나리오에 대한 강한 일반화를 보여줍니다.
결론
의사결정 정렬은 모델 능력의 발전이 어떻게 AI 안전성을 향상시키는 데 활용될 수 있는지를 보여주며, 인간 레이블 데이터에 대한 의존도를 줄이면서 준수, 거부 및 안전한 완성에 대한 보다 세밀한 제어를 제공합니다.