OpenAI o3 Deep Research 罕見遺傳病診斷
OpenAI o3 Deep Research 用於罕見遺傳疾病診斷
來自波士頓兒童醫院 Manton Center for Orphan Disease Research、哈佛大學和 OpenAI 的研究人員已經證明,OpenAI o3 Deep Research 推理模型可以幫助醫生為先前專家分析無法解釋的罕見遺傳疾病尋找候選解釋。在 2026 年 6 月 18 日發表於 NEJM AI 的一項研究中,這種 AI 輔助工作流程在 18 個先前未解決的病例中確立了診斷,代表了 4.8% 的額外診斷收益。
AI 輔助重新分析產生新診斷
OpenAI o3 Deep Research 作為一個以解釋為先的推理層,為臨床醫生提供與證據相關的假設以供審查。該模型並不會做出臨床決策或診斷;相反地,它將臨床特徵、遺傳模式、變異證據和科學文獻綜合起來,形成專家可以進行審查的論據。
在 376 個先前分析過的未解決病例中,該模型幫助確立了 18 個新診斷。特定群體的結果如下:
| 群體 | 病例數 | 發現的診斷 | 收益率 |
|---|---|---|---|
| 神經發育障礙 | 100 | 10 | 10.0% |
| 神經肌肉疾病 | 61 | 4 | 6.6% |
| 兒童突發意外死亡 | 200 | 2 | 1.0% |
| 早期精神病 | 15 | 2 | 13.3% |
| 總計 | 376 | 18 | 4.8% |
在這 18 個診斷中,有 7 個是重新發現了在本地研究工作流程之外已確立但缺失於審查記錄中的診斷,這突顯了整合碎片化數據源中資訊的難度。
技術工作流程與驗證
研究團隊為每個病例使用了結構化數據包,其中包括標準化的 Human Phenotype Ontology 術語、臨床醫生筆記、患者元數據(年齡和性別),以及包含稀有度、預測蛋白質效應、ClinVar 分類和信號質量的過濾變異表。
已解決病例的驗證
在分析未解決病例之前,團隊在已知診斷上驗證了工作流程:
- 一般罕見疾病: 在 51 個病例中的 48 個案例中,通過兩次運行找回了正確的基因和變異。
- 神經肌肉病例: 在 57 個病例中的 45 個案例中,通過兩次運行返回了正確的診斷。
- 長讀取基因組集: 在所有 15 個病例中命名了正確的基因,並在 12 個病例中找出了兩個致病等位基因。
置信度評分
模型提供的自我報告置信度評分與準確性相關。持續正確判斷的平均最低評分為 85.6,而錯誤或未知判斷的評分為 42.1。這些評分用於引導專家審查人員尋找最有希望的候選者,而不是作為臨床裁決的替代品。
進階基因組洞察與假設
該推理模型在識別複雜遺傳事件和提出新生物機制方面展現了靈活性:
結構變異推斷: 在一個早期精神病病例中,模型通過將 22 號染色體上的低質量判斷與患者的臨床特徵聯繫起來,推斷出與 DiGeorge syndrome 相關的 22q11.2 缺失,儘管該缺失並未明確列在輸入數據中。
雙基因解釋: 模型識別出兩個基因能更好地解釋臨床表現的病例,例如 LAMA2 和 FOXP1 的組合變異,以及另一個涉及 TTN 和 SRPK3 的病例。
新機制假設: 模型提出了 S1PR1 中 11 個氨基酸缺失與白癜風之間可能存在的新聯繫,認為該缺失改變了受體結構和信號傳導以減少色素生成。該假設需要進一步的實驗驗證。
表型擴展: 模型建議神經肌肉群體中 HSPB8 和 CDK13 的致病變異具有更廣泛的臨床譜。
局限性與臨床防護措施
本研究是回顧性的,並使用了去識別化的資訊。研究人員強調,該模型是一個研究工具,而非診斷設備。每一個 AI 生成的線索都必須經過嚴格的人類主導流程:由至少兩名團隊成員使用 ACMG/AMP 框架進行審查、將變異分類為致病或可能致病、由 CLIA 認證的實驗室進行確認,以及最後由醫生審查。
主要局限性包括:
- 該研究未衡量節省的時間、成本或對患者護理的改變。
- 它沒有系統地評估結構變異、重複擴增或嵌合現象。
- LLM 可能會產生看似合理但錯誤的解釋,因此需要人類進行裁決。
未來方向
在 OpenAI Foundation 資助下,Manton Center 將開發一個與平台無關、低成本的遺傳學 AI 輔助工具 (copilot)。未來的研究將集中在前瞻性多中心研究,以比較 LLM 輔助重新分析與標準實踐在診斷收益、臨床醫生工作量以及偽陽性負擔方面的差異。