OpenAI FrontierScience Benchmark Release

OpenAI는 FrontierScience를 출시했습니다. 이는 AI 모델의 전문 수준 과학 역량을 평가하기 위해 설계된 새로운 벤치마크입니다. 이 벤치마크는 기존 과학 벤치마크의 포화 상태를 해결하기 위해, 구조화된 과학적 추론과 개방형 연구 능력을 모두 측정하는 독창적이고 어려운 작업을 제공합니다.

FrontierScience 벤치마크 구조

FrontierScience는 물리학, 화학, 생물학 분야의 텍스트 기반 질문 700개 이상으로 구성되며, 주요 평가에 사용되는 "골드 세트" 160개 질문을 포함합니다. 이 벤치마크는 서로 다른 유형의 과학적 지능을 측정하기 위해 두 개의 distinct 트랙으로 나뉩니다.

FrontierScience-Olympiad

이 트랙은 국제 올림피아드 메달리스트와 국가 팀 코치(총 109개의 메달을 대표)가 설계한 100개의 질문으로 구성됩니다. 제한된 단답형 형식을 통해 과학적 추론을 평가합니다. 이러한 이론 질문은 국제 올림피아드 대회에서 출제되는 문제보다 적어도 동등한 난이도로 설계되었습니다.

FrontierScience-Research

이 트랙은 박사 수준 과학자(박사 과정 학생, 교수, 박사후 연구원 포함)가 설계한 60개의 독창적인 연구 서브태스크로 구성됩니다. 이러한 작업은 자체 포함된 다단계 문제로, 활발한 연구 중에 박사 과학자가 마주치는 난이도를 반영합니다. 이 트랙의 성능은 최종 답변과 중간 추론 단계를 모두 평가하는 10점 루브릭을 사용하여 채점됩니다.

모델 성능 및 결과

초기 평가에서 GPT-5.2가 두 트랙 모두에서 최고 성능을 보였으나, 결과는 구조화된 추론과 개방형 연구 사이의 상당한 차이를 보여줍니다:

  • FrontierScience-Olympiad: GPT-5.2가 77%를 기록했으며, Gemini 3 Pro가 76%로 근접했습니다.
  • FrontierScience-Research: GPT-5.2가 25%를 기록했습니다.

평가에는 Claude Opus 4.5, Gemini 3 Pro, GPT-4o, OpenAI o4-mini, OpenAI o3과 같은 다른 프론티어 모델도 포함되었습니다. 데이터는 더 긴 추론 노력(생각 시간)이 정확도를 향상시킨다는 것을 나타냅니다.

이러한 성과에도 불구하고, OpenAI는 프론티어 모델이 여전히 추론, 논리, 계산 오류, 사실적 부정확성, 그리고 niche 과학 개념에 대한 이해 부족으로 어려움을 겪고 있다고 지적합니다.

채점 방법론

확장성과 정확성을 보장하기 위해, OpenAI는 두 트랙에 대해 서로 다른 채점 메커니즘을 사용합니다:

  • 단답형 검증: 올림피아드 세트는 숫자, 표현, 또는 퍼지 문자열 매치를 사용하여 정확성을 검증합니다.
  • 루브릭 기반 채점: 연구 세트의 경우, 모델 기반 채점자(GPT-5)가 10점 루브릭에 따라 응답을 평가합니다. 7/10점 이상을 얻으면 해당 솔루션은 "정확"으로 간주됩니다. 이 루브릭 기반 접근 방식은 최종 출력뿐만 아니라 중간 추론 단계도 분석할 수 있게 해줍니다.

과학 연구에 대한 함의

FrontierScience는 표준화된 측정 도구이지만, OpenAI는 GPT-5와 같은 모델이 이미 실제 과학 워크플로를 가속화하고 있다고 보고합니다. 논문 Early science acceleration experiments with GPT-5 (2025년 11월)에 따르면, 이러한 시스템은 교차 분야 문헌 검색과 복잡한 수학적 증명에 사용되어, previously weeks-long 작업을 시간 단위로 줄이는 경우가 많습니다.

OpenAI는 FrontierScience를 전문 수준 추론을 위한 "북극성"으로 positioning하지만, 벤치마크의 한계를 인정합니다. 현재 진정한 새로운 가설을 생성하는 능력이나 물리적 실험 시스템 및 멀티모달 데이터(예: 비디오)와 상호작용하는 능력을 측정하지는 않습니다.

Sources