OpenAI가 계산 생물학 추론을 위한 GeneBench-Pro를 소개합니다
OpenAI가 계산 생물학 추론을 위한 GeneBench-Pro를 소개합니다
OpenAI가 계산 생물학에서 AI 모델이 실제 세계에서 필요한 판단이 무거운, 반복적 분석을 처리할 수 있는지 테스트하기 위해 설계된 벤치마크인 GeneBench-Pro를 도입했습니다. 사실 회상이나 사전 정의된 워크플로를 테스트하는 전통적인 벤치마크와 달리, GeneBench-Pro는 "연구 감각"—모호함을 처리하고, 가정을 수정하며, 결정 준비 결과에 도달하기 위한 올바른 분석 경로를 선택하는 능력을 측정합니다.
"연구 감각" 측정 및 과학적 판단
GeneBench-Pro는 과학 연구에서 AI 성능을 제한하는 시스템 수준의 판단 호출에 초점을 맞춥니다. 벤치마크는 "연구 감각"을 분석을 형성하는 판단 호출의 사슬로 정의하며, 이는 데이터가 지원할 수 있는 질문을 결정하고 초기 진단에 따라 초기 계획을 수정할 시기를 아는 것을 포함합니다.
이러한 능력을 테스트하기 위해 각 문제는 모델에게 다음을 제공합니다:
- 현실적이고 복잡한 데이터셋.
- 간단한 실험 맥락.
- 하류 결정과 연결된 목표 추정치.
모델은 데이터를 탐색하고 적절한 분석 접근법을 선택하여 최종 답을 제공하기 위한 반복적인 실험 과정에 참여해야 합니다.
데이터셋 구성 및 도메인 커버리지
GeneBench-Pro는 유전학, 정량 생물학, 번역 의학 분야의 10개 도메인과 21개 하위 도메인에 걸쳐 129개의 질문으로 구성됩니다. 임의적인 저자 선호도나 수치적 무감각과 같은 일반적인 벤치마크 실패를 피하기 위해 OpenAI는 합성 데이터 생성을 활용했습니다.
데이터 생성 과정을 시뮬레이션하고 전체 인과 구조를 알면서 OpenAI는 다음과 같이 보장했습니다:
- 주관적인 분석 선택의 합리적인 차이는 여전히 허용되는 수치적 결과를 생성합니다.
- 타당하지만 잘못된 분석은 실패합니다.
- 상세한 추적 분석을 통해 정보 누출과 의도하지 않은 해결 경로가 최소화됩니다.
또한, 129개 질문 중 82개는 외부 도메인 전문가(교수, 산업 과학자, 박사후 연구원 포함)에 의해 감사를 받아 현실성, 목표 답의 식별 가능성, 방법의 적절성을 검증했습니다.
평가 프레임워크 및 채점
에이전트는 Python, 과학 컴퓨팅 라이브러리, PLINK 2.0과 같은 기본 유전학 패키지를 포함한 표준 바이오인포매틱스 스택이 갖춰진 격리된 워크스페이스에서 평가됩니다.
데이터가 합성적으로 생성되었기 때문에 정확성은 알려진 목표에 대해 결정적으로 채점됩니다.これにより、루브릭 기반 평가와 관련된 변수성과 장황함 효과가 제거됩니다.
OpenAI는 Hugging Face에서 10개의 대표 질문을 오픈소스화하고, 독립적인 제3자 벤치마킹을 위해 Artificial Analysis에 50문제 하위 세트를 제공할 예정입니다.
성능 결과 및 모델 비교
GPT-5.6 Sol은 벤치마크에서 가장 높은 성능을 보인 모델로, Pro 모드 활성화 시 합격률 31.5%(최고 추론 수준에서는 28.7%)를 달성했습니다. 이는 원래 GeneBench에서 최고 성능을 보인 프론티어 모델인 GPT-5가 5% 미만을 기록한 것에 비해 상당한 향상입니다.
결과의 주요 내용은 다음과 같습니다:
- 테스트 타임 컴퓨팅 확장: 최고 추론 수준에서 GPT-5.6 Sol은 약 두-thirds의 토큰을 사용하면서 GPT-5.2보다 거의 여섯 배 많은 질문을 해결합니다.
- 모델 가족 간 격차: GPT 모델은 GLM 5.2와 같은 선도적인 오픈소스 모델보다 우수한 성능을 보였습니다. OpenAI는 고수준 과학적 추론에서의 성능 격차가 코딩 벤치마크에서 보이는 격차보다 훨씬 크다고 지적하며, 이는 오픈소스 모델이 일반 추론보다는 코딩에 더 특화되어 있을 수 있음을 시사합니다.
- 인간 노동과의 비교: 검토자들은 일반적인 GeneBench-Pro 문제가 인간 전문가가 완료하는 데 20~40시간이 걸릴 것으로 추정했습니다. 현재 AI 에이전트는 전문가를 대체하기에 너무 신뢰할 수 없지만, 추론 비용(수 달러)은 추정된 인간 노동 비용(수천 달러)에 비해 몇 주기 낮습니다.
과학적 발견에 대한 함의
프론티어 모델은 여전히 문제의 삼분의 일 미만을 해결하지만, 어려운 작업에서 부분적인 진전을 이루는 능력을 보여줍니다. OpenAI는 현재 실패 패턴—관측을 하지만 이를 더 넓은 맥락에 통합하는 데 어려움을 겪는 것—이 인간 초보자와 전문가 사이의 차이를 반영한다고 제안합니다.
AI 에이전트가 이러한 분석을 안정적으로 자동화할 수 있다면, 가설 삼각 측정, 목표 우선순위 지정, 데이터 생성과 결정 사이의 반복 주기를 가속화함으로써 산업 연구를 변화시킬 수 있으며, 과학적 발견의 병목 현상이 데이터 생성에서 실행 가능한 통찰의 추출로 이동할 수 있습니다.
Sources
- OriginalIntroducing GeneBench-Pro