OpenAI 與 Penda Health AI 臨床副駕駛研究
OpenAI 與 Penda Health 開發並研究了 AI Consult,這是一款由大型語言模型(LLM)驅動的臨床副駕駛,能顯著降低基層醫療的醫療錯誤。在肯亞奈洛比 15 家診所共 39,849 次患者就診的研究中,使用 AI Consult 的臨床醫師相較於未使用該工具的醫師,診斷錯誤降低了 16%(相對),治療錯誤降低了 13%。
Closing the Model-Implementation Gap
雖然 GPT-4o 與 o3 等前沿模型在 HealthBench 等基準測試以及診斷推理等任務上表現優異,但模型能力與實際臨床使用之間仍存在「模型‑實施差距」。為了解決此問題,OpenAI 與基層醫療提供者 Penda Health 合作,將 LLM 直接整合進臨床工作流程,而不僅僅是簡單的 AI 查詢。
AI Consult: Technical Implementation and Workflow
AI Consult 已整合至 Penda 的電子健康紀錄(EHR)系統,作為即時安全網運作。它會在就診的關鍵時點分析(已去除患者識別資訊的)文件,並將其傳送至 OpenAI API。系統透過分層警示機制提供回饋:
- Green:勾號,表示沒有問題。
- Yellow:鈴聲,表示中度問題,臨床醫師可自行選擇查看。
- Red:強制彈出視窗,針對安全關鍵議題,必須在醫師繼續之前先查看。
為確保安全與在地相關性,系統設計讓醫師保有所有最終決策的完整控制權。提示內容依據肯亞的流行病學背景、在地臨床指南以及 Penda 的標準作業流程進行客製化。
Impact on Quality of Care
對 108 位獨立醫師隨機抽取的 5,666 次就診進行分析,結果顯示 AI Consult 在四個關鍵面向上顯著降低錯誤率:
| 維度 | 相對錯誤降低率 |
|---|---|
| 病史採集 | 32% |
| 檢查 | 10% |
| 診斷 | 16% |
| 治療 | 13% |
在 AI Consult 觸發「Red 警示」的就診中,效果更為顯著,診斷錯誤降低 31%,治療錯誤降低 18%。以絕對值計算,僅在 Penda 即可每年避免約 22,000 起診斷錯誤與 29,000 起治療錯誤。
The Role of Active Deployment
研究指出僅有模型能力不足以促成醫師採用,主動部署至關重要。在最初的「導入期」中,醫師常忽略 Red 警示,"left in red rate"(未處理的 Red 警示比例)高達 35‑40%,與非 AI 組相當。
Penda 採取了主動部署策略以降低此比例,具體措施包括:
- Peer Champions:分支經理與同儕提供一對一指導,說明工具的限制。
- Measurement:根據追蹤的互動率進行個別化教練。
- Incentives:對有效使用工具的醫師與診所給予表揚。
在這些介入之後,AI 組的 "left in red rate" 降至 20%,而非 AI 組仍維持在約 40%。
Clinician Feedback and Patient Outcomes
醫師回饋指出 AI Consult 如同「房間裡的顧問」與「學習工具」。資料顯示使用 AI 的醫師隨時間觸發的 Red 警示比例下降(從 45% 降至 35%),暗示該工具有助於提升其臨床技能。
關於患者結果,研究發現:
- Patient Recovery:AI 組有 3.8% 的患者在八天後仍未感覺好轉,非 AI 組為 4.3%(差異未具統計顯著性)。
- Safety:AI 組有 7 起患者安全報告,非 AI 組有 5 起。沒有任何 AI Consult 的建議導致傷害,雖然若被採納部分本可防止傷害。
Future Directions
OpenAI 與 Penda Health 將 AI Consult 視為早期原型。未來版本可能加入語音優先介面以減輕文件負擔,或開發在醫師確認後能於健康紀錄內執行動作的代理人。Penda 目前正與 PATH 合作進行隨機對照試驗,以進一步測量長期對患者結果的影響。