오픈 메디컬-LLM 리더보드: 의료 분야 대형 언어 모델 벤치마킹

Hugging Face는 오픈 메디컬-LLM 리더보드를 출시했습니다. 이 표준화된 플랫폼은 다양한 의료 작업에 걸쳐 대형 언어 모델(LLM)의 성능을 평가하고 비교하도록 설계되었습니다. 이 이니셔티브는 의료 분야에서 도메인 특화 벤치마킹의 중요한 필요성을 해결합니다. 모델 출력의 부정확성은 환자 치료와 치료 결과에 심각한 영향을 미칠 수 있기 때문입니다.

평가 프레임워크 및 데이터셋

오픈 메디컬-LLM 리더보드는 정확도를 주요 평가 지표로 사용하여 여러 전문 의료 QA 데이터셋에서 모델이 제공한 정답 비율을 측정합니다.

MedQA

MedQA는 미국 의사 면허 시험(USMLE)에서 추출한 객관식 질문으로 구성되어 있으며, 미국 의사 면허 취득에 필요한 의료 지식 및 추론 능력을 평가합니다. 개발 세트에 11,450개, 테스트 세트에 1,273개의 질문이 포함되어 있습니다.

MedMCQA

인도 의료 입시 시험(AIIMS/NEET)에서 파생된 MedMCQA는 2.4k개의 의료 주제와 21개의 의료 과목을 포괄하는 대규모 데이터셋입니다. 개발 세트에 187,000개가 넘는 질문, 테스트 세트에 6,100개의 질문이 포함되어 있습니다.

PubMedQA

PubMedQA는 1,000개의 전문가 라벨링 쌍으로 구성된 폐쇄형 도메인 QA 데이터셋입니다. 모델은 관련 PubMed 초록을 기반으로 예/아니오/아마도 답변을 제공해야 하며, 과학적 생물의학 문헌을 이해하고 추론하는 능력을 테스트합니다.

MMLU 하위 집합

리더보드는 Measuring Massive Multitask Language Understanding (MMLU) 벤치마크의 특정 하위 집합을 활용하여 전문 분야를 평가합니다:

  • Clinical Knowledge: 임상 의사결정에 관한 265문제.
  • Medical Genetics: 100문제.
  • Anatomy: 135문제.
  • Professional Medicine: 272문제.
  • College Biology: 144문제.
  • College Medicine: 173문제.

주요 인사이트 및 모델 분석

다양한 모델을 평가한 결과, 상업용 모델과 오픈소스 모델 간에 성능 격차가 존재하지만, 일부 소형 모델은 경쟁력을 유지하고 있음을 확인했습니다:

  • 상업용 우위: GPT-4-base와 Med-PaLM-2는 여러 의료 데이터셋에서 일관되게 가장 높은 정확도 점수를 기록합니다.
  • 오픈소스 경쟁력: 약 70억 파라미터 규모의 모델들(예: Starling-LM-7B, gemma-7b, Mistral-7B-v0.1, Hermes-2-Pro-Mistral-7B)은 특정 작업에서 경쟁력 있는 성능을 보입니다.
  • 공통 강점: 상업용·오픈소스 모두 임상 지식 적용(MMLU Clinical Knowledge)과 생물의학 문헌 추론(PubMedQA)에서 좋은 성과를 보입니다.
  • Gemini Pro 성능: Gemini Pro는 생물통계학, 세포생물학, 산부인과 등 데이터·절차 중심 작업에서 뛰어나지만, 해부학, 심장학, 피부과에서는 중간 이하의 성능을 보입니다.

모델 제출 요구 사항

리더보드에서 평가받기 위해 연구자는 모델이 다음 기술적 기준을 충족해야 합니다:

  1. Safetensors 형식: 모델 가중치는 안전하고 빠른 로딩을 위해 safetensors 형식으로 변환해야 합니다.
  2. AutoClasses 호환성: 모델과 토크나이저는 Transformers 라이브러리의 AutoConfig, AutoModel, AutoTokenizer 클래스를 사용해 로드 가능해야 합니다.
  3. 공개 접근성: 모델은 공개적으로 접근 가능해야 하며, 비공개 모델은 평가 대상이 될 수 없습니다.

현재 리더보드는 use_remote_code=True가 필요한 모델을 지원하지 않으며, 해당 기능은 개발 중입니다.

향후 로드맵

오픈 메디컬-LLM 리더보드는 다음과 같은 방향으로 범위를 확대할 계획입니다:

  • 다양한 데이터셋: 방사선학, 병리학, 유전체학 데이터를 산업 및 연구 협력을 통해 포함합니다.
  • 고급 메트릭: 단순 정확도를 넘어 포인트와이즈 점수 및 의료 애플리케이션의 고유 요구를 더 잘 포착하는 도메인 특화 메트릭을 탐색합니다.

Sources