「看似合理」紀錄的危險:AI 紀錄員與醫療保健中的準確性危機
將 AI 「紀錄員」整合到臨床工作流程中,曾被承諾為緩解醫師過勞的良方,提供了一種自動化繁瑣醫療文件記錄過程的方法。然而,安大略省衛生部最近對 AI Scribe 系統進行的一項審計揭示了一個令人清醒的現實:這些工具在最基本的實事準確性層面上經常失敗。
當 AI 總結患者就診情況時,它不僅是在轉錄文字;它還在解釋意義。安大略省的審計人員發現,超過 60% 的受評 AI Scribe 系統在患者筆記中搞混了處方藥物。更令人擔憂的是,20 個系統中有 9 個被發現捏造了資訊或對患者治療計劃提出了未經授權的建議。在一個小數點放錯位置或藥名搞混都可能致命的領域,這些錯誤率不僅僅是技術故障——它們是關鍵的安全風險。
流暢度的幻象
大型語言模型 (LLMs) 最陰險的面向之一,是它們能夠產生高度自信、語法正確但事實上與現實脫節的散文。這通常被稱為「幻覺」,但在醫療背景下,它表現為插入了聽起來很合理但從未發生過的症狀或診斷。
用戶體驗反映了審計的發現。一位患者報告說被診斷出跑步者膝 (Runner's Knee),結果發現 AI 總結聲稱他們患有骨質疏鬆症、髖部疼痛和行走困難——這些在就診期間都沒有被提及。正如一位觀察者所指出的:
"LLMs 並非普通的語音轉文字 (STT) 軟體,也不應該被當作那樣處理。它們經常會插入整個從未發生過的句子。"
這突顯了對這些工具運作方式的根本誤解。它們不僅僅是將音訊轉換為文字 (STT);它們通常會將該文字總結成一份結構化的筆記。在「修正」逐字稿以使其看起來合理化的過程中,AI 可能會用與某種診斷相關的常見症狀來填補空白,有效地為患者虛構了一段醫療史。
超越醫療保健:失敗的模式
雖然醫療領域的風險最高,但 AI 在表現出精密的同時卻在基本邏輯上失敗的傾向,是各行各業中不斷出現的主題。使用 LLM 筆記記錄器進行企業會議的專業人士報告了類似的問題,即細微的討論被簡化成不準確的總結,導致了關於已做出的承諾或已達成的協議的爭議。
有一種日益增長的觀點認為,這些失敗並非需要修補的「錯誤」(bugs),而是當前架構的內在限制。一位批評者將這種體驗比作恐怖電影:
"它在某些令人印象深刻的方式下運作得很好,然後在重要細節上以一種『如果真的能做到 AI 所聲稱能做到的事情,那真的不應該發生』的方式失敗。"
人為因素與責任歸屬缺口
有人認為醫師也也會犯錯,且與人類的基準錯誤率相比,60% 的錯誤率可能算「正常」。然而,AI 錯誤的性質是不同的。人類的錯誤通常是疏忽;AI 的錯誤通常是將捏造的內容作為事實呈現。
這造成了巨大的責任歸屬缺口。如果醫師依賴 AI 生成的總結而沒有仔細檢查原始逐字稿,他們就是在簽署一份可能被虛構化的患者健康狀況版本。這導致一些專業人士採取極端謹慎的態度,甚至有人在每次會議開始時都加上免責聲明:"Any comments made... that are interpreted by AI in this meeting, may not be accurate."
通往更安全實施的路徑
為了降低這些風險,討論正轉向更透明且可驗證的系統。潛在的防護措施包括:
- 時間戳記連結: 將總結中的每一項主張主張直接連結到音訊錄音中的特定時間戳記,以便進行即時驗證。
- 原始逐字稿優先: 將 AI 總結視為草稿,必須根據原始逐字稿進行核對,而非將其視為主要紀錄。
- 嚴格驗證: 在將這些工具部署於實際環境之前,超越「SOC compliance」並實施嚴格的臨床準確性測試。
隨著 AI 繼續滲透專業服務,安大略省的審計結果提供了一個關鍵的警告:流暢度並不等於準確性,而在醫療保健中,兩者的差異可能關乎生死。