AI 정렬에서 구드하트 법칙 측정
OpenAI는 구드하트 법칙을 AI 정렬에 적용한 분석을 수행하여, 프록시 목표(예: 보상 모델)가 최적화의 주요 대상이 될 경우, 인간 의도나 사실 정확도와 같은 실제 목표를 신뢰할 수 있는 측정값으로서의 역할을 잃을 수 있음을 보여주었습니다.
AI 정렬에서 프록시 목표의 도전
도움fulness나 사실 정확도와 같은 복잡한 목표를 최적화하는 것은 비용이 많이 드는 인간 검증이 필요하기 때문에 어렵습니다. 이를 해결하기 위해 AI 연구소들은 보상 모델—인간 선호도를 예측하도록 학습된 모델—을 프록시 목표로 사용합니다. 그러나 이러한 프록시를 과도하게 최적화하면 모델이 실제 목표를 개선하지 못하면서도 보상 모델에서 높은 점수를 얻는 발산 현상이 발생할 수 있습니다.
분석 도구로서 Best-of-n 샘플링
Best-of-n 샘플링(거절 샘플링 또는 재정렬이라고도 함)은 $n$개의 응답을 샘플링하고 그 중 프록시 점수가 가장 높은 것을 선택함으로써 프록시 목표를 최적화하는 간단한 방법입니다. 이 접근법은 수학적으로 직관적이고 신뢰할 수 있는 성능을 제공하므로 구드하트 법칙을 연구하는 데 유용합니다.
분석을 위한 수학적 프레임워크
최적화의 영향을 측정하기 위해 OpenAI는 두 가지 주요 지표를 사용합니다:
- 진정한 목표 기대값: $\mathbb{E}{x^{'} \sim P^{'}} [R{\text{true}}(x^{'})]$는 실제 목표가 얼마나 잘 최적화되고 있는지를 측정합니다.
- KL 발산: $D_{\text{KL}}(P^{'} \parallel P)$는 최적화가 적용된 정도를 측정하며, 여기서 $P$는 원래 분포이고 $P^{'}$는 최적화된 분포입니다.
Best-of-n 샘플링의 경우, KL 발산은 모든 연속 확률 분포에 대해 정확한 식 $\log n - \frac{n-1}{n}$ 로 표현됩니다. 이를 통해 연구자들은 최적화 정도가 증가함에 따라 실제 목표가 어떻게 변하는지를 정확히 추적할 수 있습니다.
추정 효율성
단순한 몬테카를로 추정기를 사용하는 대신, OpenAI는 실제 목표에 대한 보다 효율적인 추정기를 사용합니다. $N$개의 샘플 풀에서 크기 $n$인 모든 가능한 부분집합을 고려하여, 각 샘플이 프록시 목표에 따라 최선인 부분집합의 수만큼 가중치를 부여합니다. 이 가중치는 이항 계수 $\binom{N-1}{n-1}$ (특히 샘플의 순위 $k$를 사용) 에 기반합니다.
WebGPT에서의 실증적 발견
WebGPT 175B를 대상으로 한 테스트에서, best-of-n 샘플링은 보다 고급 기술과 경쟁력을 보였습니다. 특히, best-of-64 모델이 강화 학습(RL) 모델보다 성능이 우수했는데, 이는 더 큰 샘플 크기가 모델이 더 많은 웹사이트를 탐색하도록 했기 때문일 수 있습니다. best-of-4로의 작은 증가조차도 인간 선호도에 큰 향상을 제공했습니다.
최적화 확장: Best-of-n vs. 강화 학습
best-of-n 샘플링은 소규모 최적화에는 효과적이지만, $n$에 따라 KL 발산이 로그 형태로만 증가하기 때문에 대규모에서는 한계가 있습니다.
- 계산 효율성: 구드하트 법칙으로 인해 실제 목표가 감소하기 전에 RL을 통해 자주 도달하는 KL 발산 10 nats 수준에 도달하려면, best-of-n 샘플링은 $n$이 약 60,000이어야 합니다.
- 정보 이론적 효율성: 작은 KL 예산에서는 best-of-n 샘플링이 프록시와 실제 목표 모두를 최적화하는 데 RL보다 더 효율적입니다. 이는 정보 이론적으로는 더 효율하지만 큰 KL 규모에서는 계산 효율성이 낮은 "무차별" 접근법으로 설명됩니다.
궁극적으로 이 연구의 목표는 보상 모델링과 강화 학습(RL) 방식을 개선하여 구드하트 법칙의 부정적 영향을 일으키지 않으면서 더 큰 KL 발산에 도달하는 것입니다.
Sources
- OriginalMeasuring Goodhart’s law