OpenAI의 수학 문장제 문제 해결 및 GSM8K 데이터셋
OpenAI는 미세 조정된 GPT-3 모델보다 거의 두 배 높은 정확도로 초등학교 수학 문장제 문제를 해결할 수 있는 시스템을 개발했습니다. 이 시스템은 새로운 벤치마크에서 55%의 성공률을 달성했으며, 이는 동일한 테스트에서 60%를 기록한 9-12세 어린이 소수 표본의 수준의 약 90%에 해당합니다.
다단계 추론 실패 극복하기
GPT-3와 같은 대규모 언어 모델은 일반적으로 정확한 다단계 추론을 요구하는 작업에서 어려움을 겪습니다. 이러한 모델들은 올바른 수학적 해법의 스타일과 리듬을 흉내 낼 수는 있지만, 빈번하게 치명적인 논리적 오류를 범합니다. 자기회귀(autoregressive) 모델은 토큰을 순차적으로 생성하기 때문에, 오류가 발생하면 이를 수정할 수 있는 내장된 메커니즘이 부족합니다. 단 한 번의 실수가 나머지 해법을 복구 불가능하게 만드는 경우가 많습니다.
이를 해결하기 위해 OpenAI는 모델이 자신의 실수를 인식하고 올바른 해법을 찾을 때까지 반복할 수 있도록 하는 검증 시스템을 구현했습니다. 이 접근 방식은 단순한 생성에서 여러 제안된 해법을 평가하는 것으로 초점을 전환합니다.
GSM8K 데이터셋
수학적 추론에 대한 연구를 촉진하고 평가하기 위해 OpenAI는 GSM8K 데이터셋을 공개했습니다.
데이터셋 특징
- Composition: 8.5K 고품질 초등학교 수학 문장제 문제.
- Complexity: 각 문제는 해결을 위해 2단계에서 8단계 사이의 과정이 필요합니다.
- Operations: 해법은 덧셈, 뺄셈, 곱셈, 나눗셈을 포함한 기초 산술 연산을 기반으로 합니다.
- Format: 해법은 순수 수학적 표현보다는 자연어로 작성되어, 인간이 해석하기 더 쉽고 방법론이 도메인에 구애받지 않도록 만듭니다.
OpenAI는 GSM8K의 개념은 기초적이지만, 문제의 높은 다양성으로 인해 최첨단 미세 조정 언어 모델들이 저조한 성능을 보입니다를 언급했습니다.
오류 수정을 위한 검증기(Verifier) 학습시키기
OpenAI는 제안된 해법이 올바른지 평가하는 검증기를 학습시켜 성능을 향상시켰습니다. 단일 출력에 의존하는 대신, 시스템은 주어진 문제에 대해 100개의 후보 해법을 생성하고 검증기를 사용하여 가장 높은 순위의 후보를 선택합니다.
검증에 관한 주요 발견
- Efficiency: 검증은 종종 생성보다 더 간단한 task인 경우가 많으며, 데이터셋이 충분히 클 경우 강력한 성능 향상을 제공합니다.
- Scaling: 전체 학습 세트에서, 검증을 사용하는 6B 파라미터 모델은 미세 조정된 175B 파라미터 모델보다 약간 더 나은 성능을 보였습니다. 이는 검증이 모델 크기를 약 30배 증가시킨 것과 거의 동등한 성능 향상을 제공함을 시사합니다.
- Risk of Overfitting: 데이터셋이 너무 작으면, 검증기는 수학적 추推理의 근본적인 속성을 학습하기보다 최종 정답을 암기함으로써 과적합(overfitting)될 수 있습니다.
범용 AI를 위한 시사점
올바른 논거를 생성하고 잘못된 것을 인식하는 능력은 범용 AI의 근본적인 요구 사항입니다. 초등학교 수학은 개념적으로는 단순하지만 미세한 오류에 매우 민감하기 때문에 이상적인 테스트베드로 역할을 합니다. 성공적인 해법과 실패한 시도를 구분하는 모델을 학습시킴으로써, OpenAI는 향후 더 논리적으로 복잡한 영역에 적용 가능한 기술을 개발하는 것을 목표로 합니다.
Sources
- OriginalSolving math word problems