OpenAI가 프로세스 감독을 통한 수학적 추론 개선

OpenAI는 과정 감독(process supervision)을 구현하여 수학적 문제 해결에서 새로운 최첨단 성능을 달성했습니다. 이는 모델이 올바른 최종 답만 보상하는 대신 추론의 각 올바른 단계에 보상을 주는 방법입니다. 이 접근 방식은 수학적 성능을 향상시킬 뿐만 아니라, 인간이 승인한 사고 사슬을 생성하도록 모델을 훈련시켜 AI 정렬도 개선합니다.

Process Supervision vs. Outcome Supervision

과정 감독은 사고 사슬의 각 개별 단계에 피드백을 제공하는 반면, 결과 감독은 최종 결과에만 기반하여 피드백을 제공합니다. 이 구분은 최첨단 대형 언어 모델에서도 발생하는 논리적 오류인 '환각'(hallucinations)을 완화하는 데 중요합니다.

과정에 보상을 주면 모델은 인간이 승인한 논리적 경로를 직접 따르도록 훈련됩니다. 반면, 결과 감독은 우연히 올바른 최종 답에 도달하는 비정렬되거나 잘못된 추론 과정을 의도치 않게 보상할 수 있어 검토가 어려워지고 신뢰도가 낮아집니다.

Impact on AI Alignment on AI Alignment and the "Alignment Tax"

과정 감독은 AI 정렬에 다음과 같은 여러 가지 뚜렷한 장점을 제공합니다:

  • 해석 가능한 추론: 모델이 인간이 승인한 과정을 따르도록 장려되므로 resulting reasoning chains(결과적인 추론 사슬)가 더 해석 가능해집니다.
  • 직접 정렬: 추론 과정의 각 단계에 정밀한 감독이 가해져 모델이 정렬된 사고 사슬을 준수하도록 보장합니다.
  • 부정의 정렬 세금(negative alignment tax): 일반적으로 더 안전한 AI 방법을 구현하면 성능이 저하되는 현상이 발생하는데これを '정렬 세금'(alignment tax)이라고 합니다. 그러나 수학 분야에서는 과정 감독이 '부정의 정렬 세금'(negative alignment tax)을 초래하는데, 이는 모델의 능력을 실제로 높이면서 동시에 정렬도 개선함을 의미합니다.

Performance Benchmarks on the MATH Dataset

OpenAI는 MATH 테스트 세트를 사용하여 과정 감독 및 결과 감독 보상 모델을 평가했습니다. 평가에서는 각 문제에 대해 여러 가지 솔루션을 생성하고 해당 보상 모델이 가장 높은 순위를 매긴 솔루션을 선택했습니다.

주요 발견 사항은 다음과 같습니다:

  • 우수한 정확도: 과정 감독 보상 모델은 모든 테스트 시나리오에서 결과 감독 보상 모델보다 성능이 뛰어났습니다.
  • 증가된 신뢰도: 문제당 고려되는 솔루션 수가 증가함에 따라 두 방법 사이의 성능 격차가 넓어졌으며, 이는 과정 감독 보상 모델이 올바른 추론 경로를 식별하는 데 더 신뢰할 수 있음을 나타냅니다.

Case Study: Complex Trigonometry

보상 모델의 효과를 보여주기 위해 OpenAI는 $ an 100^{\circ} + 4 \sin 100^{\circ}$ 의 간소화를 포함하는 어려운 삼각법 문제를 강조했습니다.

GPT-4는 일반적으로 이 특정 문제에 어려움을 겪으며—정답에 도달하는 솔루션 시도가わずか 0.1%에 불과함에도 불구하고—과정 감독 보상 모델은 올바른 솔루션을 정확히 인식할 수 있었습니다. 이 유효한 솔루션은 삼각법 항등식과 간소화의 복잡한 26단계 순서를 거쳐 정답인 $-\sqrt{3}$에 도달해야 했습니다.

Future Research Directions

이러한 결과는 수학적 추론에 있어 중요하지만, OpenAI는 과정 감독이 다른 영역으로 얼마나广泛하게 일반화될지 아직 알려지지 않았다고 언급합니다. 향후 연구에서는 이 방법이 비수학적 작업에서도 성능 향상과 정렬 개선의 유사한 조합을 제공할 수 있는지 탐구하는 데 중점을 둘 것입니다.

Sources