OpenAI と Penda Health の AI 臨床コパイロット研究

OpenAI と Penda Health は AI Consult を開発・検証しました。これは LLM を活用した臨床コパイロットで、一次診療における医療ミスを大幅に削減します。ケニア・ナイロビの 15 施設で 39,849 件の患者来院を対象とした研究では、AI Consult を使用した臨床医はツールを使用しなかったグループに比べ、診断エラーが 16% 減少し、治療エラーが 13% 減少しました。

モデル実装ギャップの解消

GPT-4o や o3 などの最先端モデルは HealthBench などのベンチマークや診断推論タスクで高い性能を示しますが、モデルの能力と実際の臨床現場での利用の間には「モデル実装ギャップ」が存在します。これを埋めるため、OpenAI は一次診療提供者である Penda Health と提携し、単なる AI クエリにとどまらず LLM を臨床ワークフローに直接組み込む取り組みを進めました。

AI Consult: 技術実装とワークフロー

AI Consult は Penda の電子カルテ(EHR)に統合され、リアルタイムの安全ネットとして機能します。来院中の重要なタイミングで、患者識別情報を除去したドキュメントを OpenAI API に送信し、システムは階層化されたアラートでフィードバックを提供します。

  • : 問題なしを示すチェックマーク。
  • : 中程度の懸念を示すベル音。臨床医は閲覧を選択できます。
  • : 安全上重要な問題を示す必須ポップアップ。閲覧しなければ次に進めません。

安全性とローカルな適合性を確保するため、最終的な判断はすべて臨床医が完全にコントロールします。プロンプトはケニアの疫学的状況、現地の臨床ガイドライン、Penda の標準作業手順に合わせて調整されています。

医療の質への影響

108 名の独立した医師が担当した 5,666 件のランダム抽出訪問を分析した結果、AI Consult は以下の 4 つの主要領域でエラー率を有意に低減させました。

項目 相対エラー削減率
問診 32%
検査 10%
診断 16%
治療 13%

AI Consult が「赤アラート」を発した訪問では、診断エラーが 31%、治療エラーが 18% さらに低減しました。絶対数で見ると、Penda だけで年間約 22,000 件の診断エラーと 29,000 件の治療エラーを防止できると推定されています。

アクティブデプロイメントの役割

本研究は、モデルの能力だけでは不十分で、臨床医の採用にはアクティブな展開が不可欠であることを示しました。導入初期の「インダクション期間」では、臨床医が赤アラートを無視するケースが多く、赤アラート未処理率("left in red rate")は 35〜40% で、非 AI 群と同程度でした。

Penda は以下の施策でこの率を低減させました。

  • ピアチャンピオン: 支店長や同僚が 1 対 1 のコーチングを実施し、ツールの限界を説明。
  • 測定: インタラクション率を追跡し、個別コーチングを実施。
  • インセンティブ: ツールを効果的に活用した臨床医や診療所を表彰。

これらの介入後、AI 群の赤アラート未処理率は 20% に低下し、非 AI 群は約 40% のままでした。

臨床医のフィードバックと患者アウトカム

臨床医は AI Consult を「部屋にいるコンサルタント」や「学習ツール」と評価しました。データは、AI を使用する臨床医が時間とともに赤アラートの発生率を 45% から 35% に減少させていることを示しており、ツールが臨床スキル向上に寄与していることがうかがえます。

患者アウトカムに関しては、次の結果が得られました。

  • 患者回復: AI 群では 8 日後に症状が改善しない患者は 3.8% で、非 AI 群は 4.3%(統計的有意差なし)。
  • 安全性: AI 群での患者安全報告は 7 件、非 AI 群は 5 件。AI Consult の推奨が直接的な害をもたらしたケースはなく、むしろ注意すれば防げた可能性があります。

今後の方向性

OpenAI と Penda Health は AI Consult を初期の原型と位置付けています。将来的には、文書作成負担を軽減する音声優先インターフェースや、臨床医の確認後に電子カルテ上で自動的にアクションを実行できるエージェントの実装を検討しています。Penda は現在、PATH と共同でランダム化比較試験を実施中で、患者アウトカムへの長期的効果をさらに測定しています。

Sources