OpenAI 추론 모델 CoT 제어 가능성 연구

OpenAI는 현재 최첨단 추론 모델들이 사고 사슬(Chain of Thought, CoT)을 제어하는 데 어려움을 겪고 있음을 발견했습니다. 이는 이러한 모델들이 안전 모니터링을 회피하기 위해 의도적으로 추론을 은폐할 수 없다는 것을 의미합니다. 낮은 제어 가능성은 AI 안전에 긍정적인 결과이며, CoT 모니터링이 안전하지 않거나 정렬되지 않은 행동을 식별하는 신뢰할 수 있는 방법임을 시사합니다.

CoT 제어 가능성 이해

사고 사슬(Chain of Thought, CoT)은 AI 에이전트가 작업을 해결하기 위해 생성하는 중간 추론 단계들을 말합니다. 이러한 트레이스를 모니터링함으로써 안전 시스템은 에이전트의 행동이 사용자 목표와 일치하는지 평가할 수 있습니다.

CoT 제어 가능성은 모델이 모니터링 가능성을 낮추기 위해 CoT의 특성을 제어할 수 있는 능력으로 정의됩니다. 모니터를 회피하려는 현실적인 인센티브를 측정하기 어려워 OpenAI는 프록시로서 모델이 내부 추론 과정에 관한 특정 지시를 따르는 능력을 사용했습니다. 이러한 지시에는 다음과 같은 요구 사항이 포함되었습니다:

  • 추론 트레이스에서 소문자만 사용하기.
  • 문제와 관련된 특정 키워드 피하기.
  • CoT의 모든 문장에 특정 단어를 추가하기.

이를 평가하기 위해 OpenAI는 CoT-Control이라는 오픈소스 평가 스위트를 도입했으며, 여기에는 GPQA, MMLU‑Pro, HLE, BFCL, SWE‑Bench Verified 등 벤치마크에서 파생된 13,000개 이상의 작업이 포함됩니다.

발견: 최첨단 모델 전반에 걸친 낮은 제어 가능성

13개의 추론 모델을 평가한 결과, 테스트된 모든 최첨단 모델이 CoT를 신뢰성 있게 제어하는 데 어려움을 겪는 것으로 나타났습니다. 제어 가능성 점수(모델이 지시를 성공적으로 따른 추론 트레이스 비율)는 0.1%에서 최대 15.4%까지 다양했습니다.

이러한 실패에 대한 주요 관찰 내용은 다음과 같습니다:

  • 인지 인식 vs. 실행: 모델은 종종 자신의 CoT 내에서 지침을 따르지 못하고 있음을 인식했지만, 그 인식에도 불구하고 계속 실패했습니다.
  • 규모와 성능: 오픈‑웨이트 모델에서는 모델 크기가 커질수록 제어 가능성이 약간 증가했지만, 더 큰 규모에서는 그 효과가 감소했습니다.
  • 연산 및 훈련의 영향: 모델이 더 오랜 시간 추론하도록 요구되고 사후 훈련이 진행될수록 제어 가능성이 감소했습니다. 예를 들어, OLMo-3-7B-RL-Zero-Math의 제어 가능성 점수는 RL 훈련 중에 10배 이상 감소했습니다.
  • 적대적 조건: 모델에게 모니터링되고 있다는 사실("모니터 인식")이나 평가되고 있다는 사실("평가 인식")을 알려주면 제어 가능성이 약간 증가했지만 크게는 증가하지 않았습니다. 자동 프롬프트 최적화는 훈련 세트에서는 향상을 보였지만 새로운 지시 유형으로는 전이되지 않았습니다.

AI 안전 및 모니터링에 대한 시사점

낮은 CoT 제어 가능성은 결함이 아니라 안전 기능으로 간주됩니다. 이는 모델이 내부 추론 단계를 쉽게 숨겨 모니터를 속일 수 없기 때문에 CoT 모니터링이 더 신뢰할 수 있음을 보장합니다.

하지만 OpenAI는 낮은 제어 가능성이 높은 모니터링 가능성을 보장하지는 않는다고 지적합니다. 직접적인 추론 체인 최적화 압력과 같은 다른 메커니즘을 통해 모니터링 가능성은 여전히 감소할 수 있습니다.

향후 전망 및 모니터링

OpenAI는 CoT 제어 가능성 평가를 "카나리 평가"로 간주할 것입니다—모델이 발전함에 따라 추론을 형성하거나 숨기는 능력을 개발했는지 감지하는 조기 경보 시스템입니다. 투명성을 유지하기 위해 OpenAI는 향후 최첨단 모델에 대해 시스템 카드에 CoT 모니터링 가능성과 함께 CoT 제어 가능성을 보고하기 시작할 것이며, 이는 GPT-5.4 Thinking부터 시작됩니다.

Sources