OpenAI o3 Deep Research를 이용한 희귀 유전 질환 진단

희귀 유전 질환 진단을 위한 OpenAI o3 Deep Research

보스턴 어린이 병원(Boston Children’s Hospital)의 Manton Center for Orphan Disease Research, 하버드 대학교 및 OpenAI의 연구진은 OpenAI o3 Deep Research 추론 모델이 기존 전문가 분석에서 놓쳤던 희귀 유전 질환의 후보 설명을 식별하는 데 의사들에게 도움을 줄 수 있음을 입증했습니다. 2026년 6월 18일 NEJM AI에 발표된 연구에 따르면, AI 지원 워크플로우를 통해 이전에 해결되지 않았던 18개 사례에서 진단을 확정했으며, 이는 4.8%의 추가 진단 수율을 나타냅니다.

AI 지원 재분석을 통한 새로운 진단 도출

OpenAI o3 Deep Research는 임상의가 검토할 수 있도록 증거와 연결된 가설을 제시하는 '설명 우선(explanation-first)' 추론 레이어 역할을 수행했습니다. 이 모델은 임상적 결정이나 진단을 내린 것이 아니라, 임상적 특징, 유전 패턴, 변이 증거 및 과학 문헌을 전문가가 검증할 수 있는 정당화된 근거로 합성해냈습니다.

이전에 분석되었으나 해결되지 않았던 376개 사례 중, 모델은 18개의 새로운 진단을 확정하는 데 기여했습니다. 특정 코호트별 결과는 다음과 같습니다:

코호트 사례 수 도출된 진단 수율
신경 발달 (Neurodevelopmental) 100 10 10.0%
신경 근육 질환 (Neuromuscular disease) 61 4 6.6%
소아 돌연사 (Sudden unexpected death in pediatrics) 200 2 1.0%
조기 정신증 (Early psychosis) 15 2 13.3%
합계 376 18 4.8%

이 18개의 진단 중 7개는 로컬 연구 워크플로우 외부에서 확정되었으나 검토된 기록에는 누락되어 있던 진단이 재발견된 것으로, 파편화된 데이터 소스 간의 정보를 합성하는 것이 얼마나 어려운지를 보여줍니다.

기술적 워크플로우 및 검증

연구팀은 각 사례에 대해 표준화된 Human Phenotype Ontology 용어, 임상의 노트, 환자 메타데이터(연령 및 성별), 그리고 희귀도, 예측된 단백질 효과, ClinVar 분류 및 신호 품질을 포함하는 필터링된 변이 테이블로 구성된 구조화된 데이터 패킷을 사용했습니다.

해결된 사례에 대한 검증

해결되지 않은 사례를 분석하기 전에, 연구팀은 이미 알려진 진단 사례를 통해 워크플로우를 검증했습니다:

  • 일반 희귀 질환: 51개 사례 중 48개 사례에서 두 번의 실행 결과 정확한 유전자와 변이를 찾아냄.
  • 신경 근육 사례: 57개 사례 중 45개 사례에서 두 번의 실행 결과 정확한 진단을 반환함.
  • Long-read genome 세트: 15개 사례 모두에서 정확한 유전자를 명시했으며, 12개 사례에서 두 개의 질병 유발 대립유전자를 모두 찾아냄.

신뢰도 점수 (Confidence Scoring)

모델은 정확도와 상관관계가 있는 자기 보고식 신뢰도 점수를 제공했습니다. 지속적으로 정확한 판정을 내린 경우의 평균 최소 점수는 85.6이었으며, 부정확하거나 알 수 없는 판정의 경우 42.1이었습니다. 이러한 점수는 임상적 판단을 대체하는 것이 아니라, 전문가 검토자가 가장 유망한 후보를 찾을 수 있도록 안내하는 용도로 사용되었습니다.

고급 유전체 통찰 및 가설

추론 모델은 복잡한 유전적 사건을 식별하고 새로운 생물학적 메커니즘을 제안하는 데 있어 유연성을 보여주었습니다:

  • 구조적 변이 추론: 한 조기 정신증 사례에서, 모델은 입력 데이터에 명시적으로 나열되지 않았음에도 불구하고 22번 염색체의 저품질 판정 결과와 환자의 임상적 특징을 연결하여 DiGeorge 증후군과 관련된 22q11.2 결실을 추론했습니다.
  • 이유성(Digenic) 설명: 모델은 _LAMA2_와 _FOXP1_의 결합 변이, 그리고 _TTN_과 _SRPK3_와 관련된 사례와 같이 두 유전자가 질환 양상을 더 잘 설명하는 사례를 식별했습니다.
  • 새로운 메커니즘 가설: 모델은 _S1PR1_의 11개 아미노산 결실과 백반증 사이의 새로운 연결 가능성을 제안하며, 이 결실이 수용체 구조와 신호를 변화시켜 색소 생성을 감소시킨다고 시사했습니다. 이 가설은 추가적인 실험적 검증이 필요합니다.
  • 표현형 확장: 모델은 신경 근육 코호트 내 HSPB8 및 _CDK13_의 해로운 변이에 대해 더 넓은 임상 스펙트럼을 제안했습니다.

한계점 및 임상적 가드레일

본 연구는 회고적 연구이며 익명화된 정보를 사용했습니다. 연구진은 이 모델이 연구 도구이며 진단 장치가 아님을 강조했습니다. AI가 생성한 모든 단서는 엄격한 인간 주도 프로세스를 거쳤습니다: ACMG/AMP 프레임워크를 사용하는 최소 2명의 팀원에 의한 검토, 변이의 병원성(pathogenic) 또는 병원성 가능성(likely pathogenic) 분류, CLIA 인증 실험실의 확인, 그리고 최종 의사의 검토가 포함됩니다.

주요 한계점은 다음과 같습니다:

  • 본 연구는 절약된 시간, 비용 또는 환자 케어의 변화를 측정하지 않았습니다.
  • 구조적 변이, 반복 확장(repeat expansions) 또는 모자이크 현상을 체계적으로 평가하지 않았습니다.
  • LLM은 그럴듯하지만 틀린 설명을 생성할 수 있으므로 인간의 판단이 필수적입니다.

향후 방향

OpenAI Foundation의 지원을 받는 Manton Center는 플랫폼에 구애받지 않는 저비용 유전학 AI 코파일럿을 개발할 예정입니다. 향후 연구는 진단 수율, 임상의의 노력 및 위양성 부담 측면에서 LLM 지원 재분석을 표준 관행과 비교하는 전향적 다기관 연구에 집중할 것입니다.

Sources