OpenAI HealthBench 發布
OpenAI 推出了 HealthBench,一個旨在衡量 AI 系統在真實健康情境中能力的新評估框架。該框架與來自 60 個國家的 262 位醫師合作開發,提供一套嚴謹、以醫師為基礎的方法,以評估 AI 模型是否能提供安全且有用的健康資訊。
HealthBench 資料集與方法論
HealthBench 包含 5,000 個真實、多輪且多語言的健康對話。這些情境模擬 AI 模型與個別使用者或臨床醫師之間的互動,涵蓋各種醫學專科與情境。資料集透過合成生成與人工對抗測試相結合的方式開發,以確保範例足夠具挑戰性且能代表真實使用情況。
基於評分標準的評估
與傳統考試式基準不同,HealthBench 採用基於評分標準的評分系統。每段對話都配有由醫師自行制定的評分標準,內含模型回應必須符合或避免的具體條件。
- 規模與細節: 此基準包含 48,562 項獨特的評分標準。
- 權重: 每項標準根據醫師對其重要性的判斷分配分值。
- 評分流程: 由模型式評分員(GPT-4.1)判斷每項評分標準是否符合,模型依據取得的總分相對於最高可能分數獲得最終分數。
組織結構
HealthBench 將評估分為七個主題(例如緊急情況與全球健康)以及多個軸線,定義模型行為的評分面向,如準確性、溝通品質或情境探索等。
模型表現與基準
OpenAI 評估了多代模型,發現近期前沿模型在效能、成本與可靠性方面皆有快速提升。
前沿表現
近期的 OpenAI 模型,特別是 o3,優於其他前沿模型,包括 Claude 3.7 Sonnet 與 Gemini 2.5 Pro(2025 年 3 月)。OpenAI 報告稱,其前沿模型在最近幾個月於 HealthBench 上提升了 28%。
成本與可及性
較新的模型已改變了效能‑成本的前沿。例如 GPT-4.1 nano 的表現超過 2024 年 8 月的 GPT-4o,同時成本低 25 倍。資料顯示,推理模型(o3、o4-mini、o1)隨著測試時運算資源的提升持續進步。
可靠性與錯誤率
為了因應醫療領域對可靠性的關鍵需求,OpenAI 推出了兩種專門的基準變體:
- HealthBench Consensus: 由醫師共識多次驗證的 3,671 個範例子集。相較於 GPT-4o,o3 與 GPT-4.1 在此子集上的錯誤率顯著降低。
- HealthBench Hard: 包含 1,000 個目前前沿模型仍感困難的範例子集,旨在為未來開發提供目標。
與人類醫師基準的比較
OpenAI 將模型回應與醫師撰寫的專家回應進行比較,以建立臨床基準。
- 2024 年 9 月模型: 醫師取得 o1-preview 與 GPT-4o 的回應後仍能改進這些回應,顯示醫師仍能在這些模型上提供附加價值。
- 2025 年 4 月模型: 在 o3 與 GPT-4.1 的實驗中,醫師取得模型回應後已無法再提升回應品質,暗示這些較新模型已達到或超越專家臨床判斷的表現水平,於此特定基準情境中。
可信度與驗證
為驗證模型式評分員,OpenAI 進行了「元評估」,將評分員的結果與醫師對 HealthBench Consensus 回應的審查進行比較。結果顯示,模型式評分員與醫師之間的成對一致性與個別醫師之間的一致性相似。
可取得性
HealthBench(包括評估套件與底層資料)已於 OpenAI 的 GitHub 倉庫公開,旨在支援更廣大的研究社群開發有益人類健康的 AI 系統。
Sources
- OriginalIntroducing HealthBench