"Plausible" 记录的危险:AI 记录员与医疗保健中的准确性危机

将 AI "scribe" 集成到临床工作流程中曾被承诺为缓解医生职业倦怠的良方,旨在通过自动化繁琐的医疗文档记录过程来减轻负担。然而,安大略省卫生部最近发起的一项针对 AI Scribe 系统的审计揭示了一个令人清醒的现实:这些工具在最基本的准确性层面经常失败。

当 AI 总结患者就诊情况时,它不仅仅是在转录文字;它还在解释含义。安大略省的审计人员发现,超过 60% 的受评估 AI Scribe 系统在患者笔记中混淆了处方药物。更令人担忧的是,20 个系统中发现有 9 个在伪造信息或对患者治疗方案提出未经授权的建议。在一个小数点位置错误或药物名称混淆都可能致命的领域,这些错误率不仅仅是技术故障——它们是关键的安全风险。

流利度的幻觉

大语言模型 (LLMs) 最阴险的方面之一是它们能够生成高度自信、语法正确的散文,但在事实层面却脱离了实际。这通常被称为“幻觉”,但在医学背景下,它表现为插入听起来很合理的症状或诊断,而这些症状或诊断从未发生过。

用户体验也反映了审计结果。一位患者报告称,自己被诊断为“跑步者膝”,结果却发现 AI 总结声称其患有骨质疏松症、髋部疼痛和行走困难——而这些在就诊期间从未被提及。正如一位观察者所言:

"LLMs 并非普通的语音转文本软件,也不应该被视为同类。它们经常会插入从未发生过的完整句子。"

这凸显了对这些工具工作原理的根本误解。它们不仅仅是将音频转换为文本 (STT);它们通常是将该文本总结为结构化笔记。在“修正”转录文本使其看起来合理的过程当中,AI 可能会用与某种诊断相关的常见症状来填补空白,从而有效地为患者虚构了一段病史。

超越医疗:失败的模式

虽然医学领域的风险最高,但 AI 在表现出复杂性的同时在基础逻辑上失败的倾向是各行各业的一个重复出现的主题。使用 LLM 笔记记录员进行企业会议的专业人士也报告了类似的问题,即细微的讨论被简化为不准确的准确摘要,导致了关于已做出的承诺或达成的协议的争议。

有一种日益增长的情绪认为,这些失败并非需要修补的“bug”,而是当前架构的固有局限性。一位批评者将这种体验比作恐怖电影:

"它在某些非常令人印象深刻的方式上几乎可以运作,然后在重要的细节上以一种能够做 AI 声称能做的事情的东西绝对不应该有的方式失败。"

人为因素与责任缺口

人为因素与责任缺口

有些人认为,人类医生也可能犯错,且与人类基准错误率相比,60% 的错误率可能属于“正常”范围。然而,AI 错误的性质是不同的。人类的错误通常是疏忽;而 AI 的错误通常是作为事实呈现的伪造信息。

这造成了巨大的责任缺口。如果医生依靠 AI 生成的总结,而没有仔细检查原始转录文本,他们就是在签署一份可能被虚构化的患者健康状况记录。这已导致一些专业人士采取极端谨慎的态度,甚至在每次会议开始时声明免责声明:"Any comments made... that are interpreted by AI in this meeting, may not be accurate."

通往更安全实施的路径

为了减轻这些风险,讨论正转向更透明且可验证的系统。潜在的保障措施包括:

  • 时间戳链接: 将总结中的每一项主张都直接连接到音频录音中的特定时间戳,从而实现即时验证。

  • 原始转录文本优先: 将 AI 总结视为一份必须根据原始转录文本进行核对的草案,而非主要记录。

  • 严格验证: 超越“SOC compliance”并在将这些工具部署在实际环境之前实施严格的临床准确性测试。

随着 AI 继续渗透到专业服务领域,安大略省的审计揭示了一个关键的警告:流利度并不等同于准确性,而在医疗保健领域,两者之间的区别可能关乎生死。

Sources