OpenAI HealthBench 릴리스

OpenAI는 실제 의료 시나리오에서 AI 시스템의 역량을 측정하도록 설계된 새로운 평가 프레임워크인 HealthBench를 소개했습니다. 60개국 262명의 의사와 협업해 개발된 HealthBench는 AI 모델이 안전하고 유용한 의료 정보를 제공할 수 있는지를 평가하기 위한 엄격하고 의사 기반의 방법을 제공합니다.

HealthBench 데이터셋 및 방법론

HealthBench는 5,000개의 현실적인 다중 턴, 다국어 의료 대화로 구성됩니다. 이 시나리오들은 AI 모델과 개인 사용자 또는 임상의 사이의 상호작용을 시뮬레이션하며, 다양한 의료 전문 분야와 상황을 포괄합니다. 데이터셋은 합성 생성과 인간 적대 테스트를 결합해 예시가 충분히 어려우면서 실제 사용을 대표하도록 개발되었습니다.

루브릭 기반 평가

전통적인 시험형 벤치마크와 달리, HealthBench는 루브릭 기반 채점 시스템을 사용합니다. 각 대화는 모델 응답이 충족하거나 피해야 할 구체적인 기준을 담은 의사가 만든 맞춤형 루브릭과 짝을 이룹니다.

  • 규모와 상세도: 이 벤치마크에는 48,562개의 고유 루브릭 기준이 포함됩니다.
  • 가중치: 각 기준은 의사의 중요도 판단에 따라 점수 값이 부여됩니다.
  • 채점 과정: 모델 기반 채점자 (GPT-4.1)가 각 루브릭 기준이 충족되었는지 평가하고, 모델은 획득한 총점이 최대 점수 대비 얼마나 되는지에 따라 전체 점수를 받습니다.

조직 구조

HealthBench는 평가를 일곱 개의 주제(예: 응급 상황, 글로벌 보건)와 모델 행동의 측면을 정의하는 다양한 축(정확도, 커뮤니케이션 품질, 맥락 탐색 등)으로 구성합니다.

모델 성능 및 기준선

OpenAI는 여러 세대의 모델을 평가했으며, 최신 최전선 모델이 성능, 비용, 신뢰성 측면에서 급격히 개선되고 있음을 발견했습니다.

최전선 성능

최근 OpenAI 모델, 특히 o3은 Claude 3.7 Sonnet 및 Gemini 2.5 Pro(2025년 3월) 등 다른 최전선 모델보다 우수합니다. OpenAI는 최근 몇 달 동안 HealthBench에서 최전선 모델의 성능이 28% 향상되었다고 보고했습니다.

비용 및 접근성

신형 모델은 성능‑비용 최전선을 이동시켰습니다. 예를 들어 GPT-4.1 nano는 2024년 8월 출시된 GPT-4o 모델보다 25배 저렴하면서도 더 높은 성능을 보입니다. 데이터는 추론 모델(o3, o4-mini, o1)이 테스트 시 연산량이 증가함에 따라 계속 개선되고 있음을 시사합니다.

신뢰성 및 오류율

헬스케어에서 신뢰성의 중요성을 해결하기 위해 OpenAI는 벤치마크의 두 가지 특수 변형을 도입했습니다:

  • HealthBench Consensus: 의사 합의에 의해 다중 검증된 3,671개의 예시를 포함합니다. o3GPT-4.1은 이 서브셋에서 GPT-4o에 비해 오류율이 크게 감소했습니다.
  • HealthBench Hard: 현재 최전선 모델이 어려움을 겪는 1,000개의 예시를 포함하며, 향후 개발을 위한 목표를 제공합니다.

인간 의사 기준선과의 비교

OpenAI는 모델 응답을 의사가 작성한 전문가 응답과 비교해 임상 기준선을 설정했습니다.

  • 2024년 9월 모델: 의사들이 o1-previewGPT-4o의 응답에 접근했을 때 해당 응답을 개선할 수 있었으며, 이는 의사가 여전히 이러한 모델 위에 가치를 추가할 수 있음을 의미합니다.
  • 2025년 4월 모델: o3GPT-4.1을 사용한 실험에서, 모델 응답에 접근한 의사들은 더 이상 응답 품질을 개선할 수 없었으며, 이는 최신 모델이 특정 벤치마크 시나리오에서 전문가 수준의 임상 판단과 동등하거나 이를 초과하는 성능에 도달했음을 시사합니다.

신뢰성 및 검증

모델 기반 채점자를 검증하기 위해 OpenAI는 "메타 평가"를 수행했으며, HealthBench Consensus에서 의사들이 응답을 검토한 결과와 채점자의 결과를 비교했습니다. 그 결과 모델 기반 채점자와 의사 간의 쌍별 일치도가 개별 의사들 간의 일치도와 유사함을 보여주었습니다.

제공 여부

HealthBench와 평가 스위트, 기본 데이터는 OpenAI의 GitHub 저장소에서 공개적으로 제공되어, 인간 건강에 도움이 되는 AI 시스템을 개발하려는 광범위한 연구 커뮤니티를 지원합니다.

SUMMARY: OpenAI는 5,000개의 현실적인 의료 대화와 48,562개의 의사가 만든 루브릭 기준을 포함한 새로운 벤치마크인 HealthBench를 도입하여 의료 분야에서 AI 역량을 엄격히 평가합니다.

TITLE: OpenAI HealthBench 릴리스

Sources