提升 ChatGPT 的健康智慧

提升 ChatGPT 的健康智慧

GPT-5.5 Instant 推進健康智慧

OpenAI 推出了 GPT-5.5 Instant,一款顯著提升 ChatGPT 處理健康與保健問題能力的模型。該模型在辨識緊急照護需求、請求相關使用者背景、說明不確定性以及簡化複雜健康資訊方面展現了重大進步。

GPT-5.5 Instant 已向所有 ChatGPT 免費使用者開放,擴大了對這些健康相關功能的使用。於最具挑戰性的健康評估上,其表現已可與 OpenAI 前沿的 Thinking 模型相媲美。

衡量健康表現與準確性

OpenAI 透過健康專屬的評估,確保回應的準確、易懂且基於良好判斷。進度透過以下框架進行衡量:

評估框架

  • HealthBench 與 HealthBench Professional:這些評估使用真實的健康對話與醫師撰寫的評分標準,評估準確性、安全性、溝通、情境感知、完整性以及適當的升級。
  • 醫師主導比較:由醫師組成的小組比較了 GPT-5.5 Instant 的 3,500 筆回應,與醫師(擁有無限制時間與網路但未使用 AI)撰寫的回應以及舊模型的回應。GPT-5.5 Instant 在所有指標上皆獲得更高評分,包括準確性、溝通、完整性、指示遵循以及健康決策的幫助性。

生產流量監測

為了追蹤實際表現,OpenAI 在生產流量上使用保護隱私的監測工具。對每週數十億訊息的分析顯示,含有至少一項被標記事實性問題的回應比例在過去兩個月下降了 71%。

醫師主導的模型改進

GPT-5.5 Instant 的改進由遍佈 60 個國家、使用 49 種語言、涵蓋 26 個醫學專科的全球超過 260 位醫師網路推動。此網路提供了在真實健康情境中定義「良好」回應所需的醫學專業知識。

醫師回饋的角色

  • 回應審查:醫師已審查超過 700,000 例模型回應,這些回應反映了患者與臨床醫師的真實使用情況。
  • 評分標準開發:醫師回饋用於制定評分標準與評估準則,協助研究人員衡量回應是否準確、安全、清晰、完整且具適當的謹慎性。
  • 失效模式辨識:GPT-5.5 Instant 的失效模式較先前模型與人類醫師更少,特別在根據在地醫療情境調整回應、辨識危險訊號,以及向使用者請求必要的額外背景資訊等方面表現更佳。

與更廣泛醫療工具的整合

這些在一般健康智慧方面的進步支援了 OpenAI 更廣泛的醫療計畫,包括專為醫師設計的 ChatGPT for Clinicians 與 OpenAI for Healthcare 等工具,協助醫療專業人員進行文件撰寫、研究與照護提供。

Sources