OpenAI o3 Deep Research 用于罕见遗传病诊断

OpenAI o3 Deep Research 用于罕见遗传病诊断

来自波士顿儿童医院 Manton Center for Orphan Disease Research、哈佛大学和 OpenAI 的研究人员表明,OpenAI o3 Deep Research 推理模型可以帮助医生识别之前逃脱专家分析的罕见遗传病的候选解释。在 2026 年 6 月 18 日发表于 NEJM AI 的一项研究中,AI 辅助工作流在 18 例之前未解决的病例中建立了诊断,代表了额外诊断产出 4.8%。

AI 辅助重新分析得出新诊断

OpenAI o3 Deep Research 作为一种解释优先的推理层,以临床医生审查为目的,提出了与证据相关的假设。该模型并未进行临床决策或诊断;相反,它将临床特征、遗传模式、变异证据和科学文献综合为专家可以质疑的依据。

在先前分析的 376 例未解决病例中,该模型帮助建立了 18 例新诊断。特定队列的结果如下:

队列 病例数 发现的诊断 产出
神经发育性 100 10 10.0%
神经肌肉疾病 61 4 6.6%
儿科突发意外死亡 200 2 1.0%
早期精神病 15 2 13.3%
总计 376 18 4.8%

在这 18 例诊断中,有 7 例是重新发现的诊断,这些诊断是在当地研究工作流之外建立的,但在被审查的记录中缺失,这凸显了在碎片化数据源中综合信息的困难。

技术工作流程和验证

研究团队为每个病例使用了结构化数据包,包含标准化的人类表型本体术语、临床笔记、患者元数据(年龄和性别)以及一个过滤后的变异表,其中包含罕见度、预测的蛋白质影响、ClinVar 分类和信号质量。

已解决病例的验证

在分析未解决病例之前,团队在已知诊断上验证了工作流程:

  • 一般罕见病例: 在 51 例病例的双重运行中,恢复了正确的基因和变异,共 48 例。
  • 神经肌肉病例: 在 57 例病例的双重运行中,返回了正确的诊断,共 45 例。
  • 长读取基因组集: 在全部 15 例病例中命名了正确的基因,并在 12 例病例中命名了两个致病等位基因。

置信度评分

该模型提供了与准确性相关的自报置信度分数。对于始终正确的调用,平均最低分数为 85.6,而对于错误或未知的调用则为 42.1。这些分数用于引导专家审查者指向最有希望的候选者,而不是作为临床裁决的替代。

高级基因组洞察和假设

推理模型在识别复杂遗传事件和提出新颖生物机制方面表现出灵活性:

  • 结构变异推断: 在一例早期精神病病例中,该模型通过将染色体 22 上的低质量调用与患者的临床特征相关联,推断出与 DiGeorge 综合征相关的 22q11.2 缺失,尽管该缺失在输入数据中未被明确列出。
  • 双基因解释: 该模型识别出两个基因共同更好地解释表型的病例,例如 LAMA2FOXP1 的联合变异,以及涉及 TTNSRPK3 的另一例。
  • 新颖机制假设: 该模型提出了 S1PR1 中 11 氨基酸缺失与白癜风之间可能的新颖关联,表明该缺失改变了受体结构和信号传导以减少色素生成。此假设需要进一步的实验验证。
  • 表型扩展: 该模型表明在神经肌肉队列中,HSPB8CDK13 的致损变异具有更广泛的临床谱。

局限性和临床防护措施

此研究具有回顾性,并使用了去标识的信息。研究人员强调该模型是一种研究工具,而非诊断设备。每个 AI 生成的线索都经过了严格的人主导流程:至少由两名团队成员使用 ACMG/AMP 框架进行审查,将变异致病性或可能致病性进行分类,由 CLIA 认证的实验室进行确认,以及最终由医生审查。

主要局限性包括:

  • 该研究未测量节省的时间、成本或患者护理的变化。
  • 它未系统评估结构变异、重复扩展或马赛克。
  • 大型语言模型可能产生看似合理但不正确的解释,因而需要人工裁决。

未来方向

Manton Center 在 OpenAI 基金会资助的支持下,将开发一个与平台无关、低成本的遗传学 AI 协作者。未来研究将重点放在前瞻性多中心研究上,以比较 LLM 辅助的重新分析与标准实践在诊断产出、临床工作量以及假阳性负担方面的表现。

Sources