OpenAI o3 Deep Research를 이용한 희귀 유전 질환 진단

보스턴 어린이 병원(Boston Children’s Hospital)의 Manton Center for Orphan Disease Research, 하버드 대학교 및 OpenAI의 연구진은 OpenAI o3 Deep Research 추론 모델이 기존 전문가 분석에서 놓쳤던 희귀 유전 질환의 후보 설명을 식별하는 데 의사들에게 도움을 줄 수 있음을 입증했습니다. 2026년 6월 18일 NEJM AI에 발표된 연구에 따르면, AI 지원 워크플로우를 통해 이전에 해결되지 않았던 18개 사례에서 진단을 확정했으며, 이는 4.8%의 추가 진단 수율을 나타냅니다.

AI 지원 재분석을 통한 새로운 진단 도출

OpenAI o3 Deep Research는 임상의가 검토할 수 있도록 증거와 연결된 가설을 제시하는 '설명 우선(explanation-first)' 추론 레이어 역할을 수행했습니다. 이 모델은 임상적 결정이나 진단을 내린 것이 아니라, 임상적 특징, 유전 패턴, 변이 증거 및 과학 문헌을 전문가가 검증할 수 있는 정당화된 근거로 합성해냈습니다.

이전에 분석되었으나 해결되지 않았던 376개 사례 중, 모델은 18개의 새로운 진단을 확정하는 데 기여했습니다. 특정 코호트별 결과는 다음과 같습니다:

코호트 사례 수 도출된 진단 수율
신경 발달 (Neurodevelopmental) 100 10 10.0%
신경 근육 질환 (Neuromuscular disease) 61 4 6.6%
소아 돌연사 (Sudden unexpected death in pediatrics) 200 2 1.0%
조기 정신증 (Early psychosis) 15 2 13.3%
합계 376 18 4.8%

이 18개의 진단 중 7개는 로컬 연구 워크플로우 외부에서 확정되었으나 검토된 기록에는 누락되어 있던 진단이 재발견된 것으로, 파편화된 데이터 소스 간의 정보를 합성하는 것이 얼마나 어려운지를 보여줍니다.

기술적 워크플로우 및 검증

연구팀은 각 사례에 대해 표준화된 Human Phenotype Ontology 용어, 임상의 노트, 환자 메타데이터(연령 및 성별), 그리고 희귀도, 예측된 단백질 효과, ClinVar 분류 및 신호 품질을 포함하는 필터링된 변이 테이블로 구성된 구조화된 데이터 패킷을 사용했습니다.

해결된 사례에 대한 검증

해결되지 않은 사례를 분석하기 전에, 연구팀은 이미 알려진 진단 사례를 통해 워크플로우를 검증했습니다:

  • 일반 희귀 질환: 51개 사례 중 48개 사례에서 두 번의 실행 결과 정확한 유전자와 변이를 찾아냄.
  • 신경 근육 사례: 57개 사례 중 45개 사례에서 두 번의 실행 결과 정확한 진단을 반환함.
  • Long-read genome 세트: 15개 사례 모두에서 정확한 유전자를 명시했으며, 12개 사례에서 두 개의 질병 유발 대립유전자를 모두 찾아냄.

신뢰도 점수 (Confidence Scoring)

모델은 정확도와 상관관계가 있는 자기 보고식 신뢰도 점수를 제공했습니다. 지속적으로 정확한 판정을 내린 경우의 평균 최소 점수는 85.6이었으며, 부정확하거나 알 수 없는 판정의 경우 42.1이었습니다. 이러한 점수는 임상적 판단을 대체하는 것이 아니라, 전문가 검토자가 가장 유망한 후보를 찾을 수 있도록 안내하는 용도로 사용되었습니다.

고급 유전체 통찰 및 가설

추론 모델은 복잡한 유전적 사건을 식별하고 새로운 생물학적 메커니즘을 제안하는 데 있어 유연성을 보여주었습니다:

  • 구조적 변이 추론: 한 조기 정신증 사례에서, 모델은 입력 데이터에 명시적으로 나열되지 않았음에도 불구하고 22번 염색체의 저품질 판정 결과와 환자의 임상적 특징을 연결하여 DiGeorge 증후군과 관련된 22q11.2 결실을 추론했습니다.
  • 이유성(Digenic) 설명: 모델은 _LAMA2_와 _FOXP1_의 결합 변이, 그리고 _TTN_과 _SRPK3_와 관련된 사례와 같이 두 유전자가 질환 양상을 더 잘 설명하는 사례를 식별했습니다.
  • 새로운 메커니즘 가설: 모델은 _S1PR1_의 11개 아미노산 결실과 백반증 사이의 새로운 연결 가능성을 제안하며, 이 결실이 수용체 구조와 신호를 변화시켜 색소 생성을 감소시킨다고 시사했습니다. 이 가설은 추가적인 실험적 검증이 필요합니다.
  • 표현형 확장: 모델은 신경 근육 코호트 내 HSPB8 및 _CDK13_의 해로운 변이에 대해 더 넓은 임상 스펙트럼을 제안했습니다.

한계점 및 임상적 가드레일

본 연구는 회고적 연구이며 익명화된 정보를 사용했습니다. 연구진은 이 모델이 연구 도구이며 진단 장치가 아님을 강조했습니다. AI가 생성한 모든 단서는 엄격한 인간 주도 프로세스를 거쳤습니다: ACMG/AMP 프레임워크를 사용하는 최소 2명의 팀원에 의한 검토, 변이의 병원성(pathogenic) 또는 병원성 가능성(likely pathogenic) 분류, CLIA 인증 실험실의 확인, 그리고 최종 의사의 검토가 포함됩니다.

주요 한계점은 다음과 같습니다:

  • 본 연구는 절약된 시간, 비용 또는 환자 케어의 변화를 측정하지 않았습니다.
  • 구조적 변이, 반복 확장(repeat expansions) 또는 모자이크 현상을 체계적으로 평가하지 않았습니다.
  • LLM은 그럴듯하지만 틀린 설명을 생성할 수 있으므로 인간의 판단이 필수적입니다.

향후 방향

OpenAI Foundation의 지원을 받는 Manton Center는 플랫폼에 구애받지 않는 저비용 유전학 AI 코파일럿을 개발할 예정입니다. 향후 연구는 진단 수율, 임상의의 노력 및 위양성 부담 측면에서 LLM 지원 재분석을 표준 관행과 비교하는 전향적 다기관 연구에 집중할 것입니다.

Sources

관련

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch