OpenAI 연구: 언어 모델이 환각을 일으키는 이유
환각은 평가 인센티브에 의해 촉진됩니다
언어 모델은 현재 평가 방법이 불확실성에 대한 정직함보다 추측을 보상하기 때문에 환각을 일으킵니다. 모델이 주로 정확도—정답으로 답한 질문의 비율—에 따라 평가될 때, 필요한 정보를 갖추지 못했더라도 추측하도록 인센티브가 주어집니다. 올바른 추측은 점수를 올리지만, 불확실성을 인정하고 포기(abstaining)하면 점수를 전혀 받을 수 없기 때문입니다.
OpenAI의 연구에 따르면 오류가 포기보다 더 해롭습니다. OpenAI 모델 사양에 따르면, 모델이 확신에 찬 잘못된 정보를 제공하기보다 불확실성을 표시하거나 설명을 요청하는 것이 바람직합니다. 그러나 정확도만을 기준으로 하는 점수표가 모델 카드와 리더보드를 장악하고 있기 때문에, 개발자들은 모델이 주저하기보다 추측하도록 만들 동기를 갖게 됩니다.
정확도와 환각 비율 비교
gpt-5-thinking-mini와 OpenAI o4-mini의 비교는 전략적 추측과 신뢰성 사이의 트레이드오프를 보여줍니다:
| 지표 | gpt-5-thinking-mini | OpenAI o4-mini |
|---|---|---|
| 포기율 (답변 없음) | 52% | 1% |
| 정확도 (정답) | 22% | 24% |
| 오류율 (오답) | 26% | 75% |
OpenAI o4-mini는 약간 더 높은 정확도를 가지고 있지만, 포기를 거의 하지 않기 때문에 오류율(환각 비율)이 크게 높습니다.
다음 단어 예측에서 환각의 기원
사실 부정확성은 사전 학습의 통계적 특성에서 비롯됩니다. 사전 학습 동안 모델은 방대한 텍스트에서 다음 단어를 예측함으로써 학습하며, 이때 "참/거짓" 라벨이 없습니다. 철자나 괄호와 같은 일관된 패턴은 쉽게 학습되고 규모가 커짐에 따라 이러한 영역의 오류는 사라지지만, 임의의 저빈도 사실(예: 특정 인물의 생일)은 패턴만으로 예측할 수 없습니다.
모델은 유창한 언어의 긍정적인 예시만을 보고 전체 분포를 근사해야 하기 때문에, 부정확하게 라벨링된 예시가 없으면 유효한 진술과 무효한 진술을 구별하는 데 어려움을 겪습니다. 이러한 통계적 메커니즘은 모델이 신뢰할 수 없는 저빈도 사실을 예측하려 할 때 발생하는 환각을 초래합니다.
평가 프레임워크 수정
환각을 줄이기 위해 OpenAI는 널리 사용되는 정확도 기반 평가를 업데이트하여 추측을 억제할 것을 제안합니다. 이는 다음을 포함합니다:
- 자신감 있는 오류에 대한 벌점을 불확실성보다 더 크게 부과합니다.
- 불확실성을 적절히 표현한 경우 부분 점수를 제공합니다.
OpenAI는 몇 가지 불확실성 인식 테스트를 추가하는 것만으로는 충분하지 않다고 주장합니다; 주요 점수표를 겸손을 보상하고 무분별한 추측을 억제하도록 재구성해야 환각 감소 기술의 채택을 확대할 수 있습니다.
환각에 대한 일반적인 오해 해소
OpenAI의 연구는 AI 환각의 본질에 관한 몇 가지 핵심점을 명확히 합니다:
- 정확도에 관하여: 정확도는 절대 100%에 도달하지 못합니다. 일부 현실 세계 질문은 모델 크기나 추론 능력과 무관하게 본질적으로 답할 수 없기 때문입니다.
- 불가피성에 관하여: 환각은 불가피하지 않습니다. 모델을 불확실할 때 포기하도록 설계할 수 있기 때문입니다.
- 모델 크기에 관하여: 환각을 피하기 위해 반드시 큰 모델의 지능이 필요한 것은 아닙니다; 작은 모델이 자신의 한계를 아는 것이 더 쉬울 수 있습니다(예: 특정 언어에 대한 지식이 없는 작은 모델은 단순히 포기할 수 있습니다).
- 문제의 본질에 관하여: 환각은 "신비로운 결함"이 아니라, 이해된 통계 메커니즘과 평가의 보상 구조에서 비롯됩니다.
- 측정에 관하여: 단순히 "환각 평가"를 만드는 것만으로는 충분하지 않으며, 모든 주요 평가 지표를 불확실성 표현을 보상하도록 업데이트해야 합니다.
Sources
- OriginalWhy language models hallucinate