OpenAI GDPval: 실제 지식 작업에서 모델 성능 측정

OpenAI는 경제적으로 가치 있는 실제 작업에서 AI 모델이 어떻게 수행되는지를 추적하도록 설계된 새로운 평가 프레임워크인 GDPval를 도입했습니다. 미국 국내총생산(GDP)에 가장 크게 기여하는 산업 및 직업에서 작업을 선정함으로써, GDPval는 AI 평가를 학술 벤치마크에서 실질적인 전문 생산성 측정으로 전환합니다.

GDPval 프레임워크 및 방법론

GDPval는 미국 GDP의 5% 이상을 차지하는 상위 9개 산업에 걸쳐 44개의 직업에 대한 모델 성능을 측정합니다. 평가는 1,320개의 전문 작업으로 구성되며, 그 중 "골드" 오픈소스 세트인 220개의 작업이 있습니다.

작업 선택 및 설계

경제적 관련성을 보장하기 위해 OpenAI는 직업에 대해 특정 선택 프로세스를 사용했습니다:

  • 산업 선택: 세인트루이스 연방준비은행 데이터에 기반하여, 미국 GDP의 5% 이상을 차지하는 상위 9개 산업을 선정했습니다.
  • 직업 선택: 해당 산업 내에서 총 임금 및 보상에 가장 크게 기여하는 5개의 직업을 선정했으며, 이들은 주로 지식 작업이어야 합니다.
  • 지식 작업 기준: O*NET 데이터를 사용하여, 구성 작업 중 60% 이상이 신체 작업이나 수작업을 포함하지 않을 경우 해당 직업을 인정했습니다.

데이터셋 구성

작업은 평균 14년 경력의 전문가들에 의해 제작되었습니다. 각 작업은 합성 시험 문제 대신 실제 작업 산출물(예: 간호 치료 계획, 엔지니어링 설계도, 법률 브리프 등)을 기반으로 합니다. 각 작업은 평균 5회의 전문가 검토를 거쳤으며, 여기에는 모델 기반 검증 및 동료 검토가 포함되어 대표성과 실현 가능성을 보장했습니다.

전통적인 벤치마크와 달리, GDPval 작업은 참고 파일과 컨텍스트를 포함하고 있으며, 스프레드시트, 다이어그램, 슬라이드 또는 멀티미디어 문서와 같은 산출물을 요구합니다.

모델 성능 및 평가

모델 성능은 동일한 전문 분야의 전문가 “평가자”가 수행하는 블라인드 비교를 통해 평가됩니다. 평가자는 AI가 생성한 산출물을 인간이 만든 작업과 비교하여 “더 좋음”, “동등함”, “인간 전문가보다 못함”으로 분류합니다.

주요 결과 및 벤치마크

GPT-4o, o4-mini, OpenAI o3, GPT-5, Claude Opus 4.1, Gemini 2.5 Pro, Grok 4를 포함한 블라인드 평가에서 다음과 같은 결과가 나타났습니다:

  • 인간 수준: 최첨단 모델이 산업 전문가 수준에 근접하고 있습니다. Claude Opus 4.1은 거의 절반에 가까운 작업에서 인간과 동등하거나 더 우수한 것으로 평가되었으며, 특히 미학 및 레이아웃에서 강점을 보였습니다.
  • 정확도: GPT-5는 정확도와 도메인별 지식에서 특히 뛰어났습니다.
  • 성장 추세: 성능이 GPT-4o(2024년 봄)에서 GPT-5(2025년 여름)까지 2배 이상 증가했으며, 선형 추세를 보입니다.
  • 효율성: 최첨단 모델은 인간 전문가에 비해 약 100배 빠르고 100배 저렴하게 작업을 완료할 수 있지만, 이 수치는 추론 및 API 비용만을 고려한 것이며 인간 감독 비용은 포함되지 않았습니다.

자동 평가

OpenAI는 인간 전문가 판단을 예측하도록 훈련된 AI 시스템인 “자동 평가자”를 개발했습니다. evals.openai.com에서 실험적 연구 서비스로 제공되고 있지만, 신뢰성 격차 때문에 아직 인간 전문가 평가자를 대체하지는 않습니다.

제한 사항 및 향후 개발

GDPval는 현재 일회성 평가이며, 이는 고객 피드백에 따라 문서를 수정하는 등 전문 작업의 반복적인 특성을 포착하지 못함을 의미합니다. 또한 전문가가 올바른 접근 방식을 먼저 결정한 후에 산출물을 수행해야 하는 실제 작업의 모호성을 고려하지 않습니다.

GDPval의 향후 버전은 다음을 목표로 합니다:

  • 다루는 직업 및 산업의 수를 확대합니다.
  • 인터랙티브 워크플로와 다중 초안 반복을 통합합니다.
  • 모호성을 탐색해야 하는 작업을 포함시켜 전문 지식 작업의 복잡성을 더 잘 반영합니다.

Sources