OpenAI 与 Penda Health AI 临床副驾驶研究

OpenAI 与 Penda Health 开发并研究了 AI Consult,这是一款基于大型语言模型的临床副驾驶,能够显著降低初级保健中的医疗错误。在对肯尼亚内罗毕 15 家诊所共计 39,849 次患者就诊的研究中,使用 AI Consult 的临床医生相比未使用该工具的医生,诊断错误相对降低了 16%,治疗错误相对降低了 13%。

弥合模型-实施差距

虽然 GPT-4o 和 o3 等前沿模型在 HealthBench 等基准测试以及诊断推理等任务上表现出色,但模型能力与实际临床使用之间仍存在“模型-实施差距”。为了解决这一问题,OpenAI 与初级保健提供商 Penda Health 合作,超越简单的 AI 查询,将大型语言模型直接整合到临床工作流程中。

AI Consult:技术实现与工作流程

AI Consult 已集成到 Penda 的电子健康记录(EHR)系统中,作为实时安全网运行。它在就诊的关键节点分析去除患者身份信息的文档,并将其发送至 OpenAI API。系统通过分层警报系统提供反馈:

  • 绿色:勾号,表示没有问题。
  • 黄色:响铃,表示中等关注,临床医生可选择查看。
  • 红色:强制弹窗,针对安全关键问题,必须在临床医生继续之前查看。

为确保安全性和本地相关性,系统设计为让临床医生对所有最终决策保持完全控制。提示内容针对肯尼亚流行病学背景、本地临床指南以及 Penda 的标准操作程序进行定制。

对护理质量的影响

对 108 位独立医生随机抽取的 5,666 次就诊进行分析后发现,AI Consult 在四个关键维度上显著降低了错误率:

维度 相对错误降低
病史采集 32%
检查检验 10%
诊断 16%
治疗 13%

对于 AI Consult 会触发“红色警报”的就诊,影响更为显著,诊断错误降低了 31%,治疗错误降低了 18%。从绝对值来看,估计该系统每年在 Penda 单独即可避免 22,000 起诊断错误和 29,000 起治疗错误。

主动部署的作用

研究指出,仅有模型能力不足以实现效果;主动部署对临床医生的采纳至关重要。在最初的“引导期”,临床医生常常忽视红色警报,未处理红色警报的比例(即“红色遗留率”)为 35-40%,与非 AI 组相似。

Penda 实施了主动部署策略以降低该比例,包括:

  • 同行冠军:分支经理和同事提供一对一辅导,并解释工具的局限性。
  • 测量:基于跟踪的交互率进行个性化辅导。
  • 激励:对有效使用该工具的临床医生和诊所进行表彰。

在这些干预措施之后,AI 组的“红色遗留率”降至 20%,而非 AI 组仍保持在约 40%。

临床医生反馈与患者结果

临床医生报告称 AI Consult 像是“在场的顾问”和“学习工具”。数据表明,使用 AI 的临床医生随时间触发的红色警报减少(从 45% 降至 35% 的就诊),暗示该工具帮助他们提升了自身的临床技能。

关于患者结果,研究发现:

  • 患者恢复:AI 组有 3.8% 的患者在八天后仍未感觉好转,而非 AI 组为 4.3%(差异无统计学意义)。
  • 安全性:AI 组有 7 起患者安全报告,非 AI 组有 5 起。没有 AI Consult 的建议导致伤害,尽管如果被采纳,一些本可以防止伤害。

未来方向

OpenAI 与 Penda Health 将 AI Consult 视为早期原型。未来的迭代可能包括语音优先界面,以减轻文档负担,或在临床医生确认后能够在健康记录中执行操作的代理。Penda 正在与 PATH 合作开展随机对照试验,以进一步衡量对患者长期结果的影响。

Sources