OpenAI 첫 번째 증명 제출

OpenAI는 내부 추론 모델을 활용해 First Proof 챌린지의 10개 문제 모두에 도전했습니다. First Proof는 AI가 전문 분야에서 검증 가능한 종단‑종단 논증을 생성할 수 있는지를 테스트하기 위해 설계된 연구 수준 수학 대회입니다. 이번 이정표는 모델이 장기간 추론 체인을 수행하고, 수년간 미해결 상태였던 문제들을 해결할 수 있음을 보여줍니다.

모델의 First Proof 문제 성능

OpenAI는 모델의 증명 시도 중 최소 다섯 개—특히 문제 4, 5, 6, 9, 10—가 정답일 확률이 높다고 판단합니다. 다른 몇몇 시도는 아직 검토 중이며, 공식 논평과 커뮤니티 분석을 통해 문제 2에 대한 초기 신념을 철회했습니다.

‘우리는 현재 모델을 새로 훈련시키고 있으며, 주요 목표는 사고의 엄밀성을 높이는 것입니다. 모델이 여러 시간 동안 지속적으로 사고하고 결론에 대해 높은 자신감을 유지하도록 하는 것이 목표입니다. First Proof 문제가 발표되었을 때, 이는 완벽한 시험대처럼 보였습니다… 이미 두 문제(#9와 #10)를 해결할 수 있었습니다. 훈련이 진행됨에 따라 모델은 점점 더 능력을 갖추었고, 우리 추정에 따르면 최소 세 문제를 추가로 해결했습니다.’

방법론 및 인간 감독

증명 시도는 제한된 인간 감독 하에 생성되었습니다. 구체적인 개입은 다음과 같습니다:

  • 전략 안내: 인간은 이전 시도에서 효과적이었던 전략을 다시 시도하도록 제안했습니다.
  • 정제: 모델에게 전문가 피드백을 기반으로 증명의 섹션을 확장하거나 명확히 하도록 요청했습니다.
  • 검증 지원: 내부 모델과 ChatGPT 간의 왕복 상호작용을 사용해 형식, 스타일 및 검증을 수행했습니다.
  • 선택: 여러 시도가 있을 경우 인간은 판단에 따라 최상의 버전을 선택했습니다.

OpenAI는 이번 작업이 "빠른 스프린트"였으며, 정식 평가의 통제된 환경이 부족했음을 인정하고, 향후 보다 엄격한 프레임워크를 위해 First Proof 조직자와 협력하고자 합니다.

AI 평가에서 최전선 연구의 역할

OpenAI는 새로운 최전선 연구가 차세대 AI 모델을 평가하는 가장 효과적인 방법이라고 주장합니다. 회사는 표준 벤치마크가 연구의 가장 어려운 측면을 포착하지 못한다고 지적합니다. 예를 들어:

  • 긴 추론 체인을 지속하는 것.
  • 적절한 추상화 선택.
  • 문제 진술의 모호성 처리.
  • 전문가 검증을 견디는 논증을 생성하는 것.

추론 능력의 맥락

이 결과는 수학 및 과학 분야에서 AI 추론의 일련의 발전을 기반으로 합니다:

  • 2025년 7월: 범용 추론 모델이 국제 수학 올림피아드에서 금메달 수준 성과(35/42점)를 달성했습니다.
  • 2025년 11월: GPT-5가 물리학, 생물학, 수학 분야에서 과학을 가속화할 수 있는 능력에 대한 사례 연구가 공유되었습니다.
  • 최근 개발: GPT-5.2가 이론 물리학에서 글루온 진폭 공식의 후보 표현을 제안했으며, 이는 내부 모델에 의해 정식 증명되고 저자들에 의해 검증되었습니다.

SUMMARY: OpenAI는 First Proof 연구 수준 수학 챌린지를 위해 증명 시도를 제출했으며, 내부 모델이 10문제 중 최소 5문제를 해결했을 가능성이 있습니다.

TITLE: OpenAI 첫 번째 증명 제출

Sources