OpenAI 推出 MentalHealthBench

OpenAI 發布了 MentalHealthBench,這是一個開放的基準測試工具,旨在衡量人工智慧系統在面對現實心理健康的對話時的表現。此工具讓研究人員與開發者能夠在多樣化的場景中評估模型效能,確保人工智慧的回應符合專家臨床指導,同時優先考慮使用者的安全與福祉。

跨嚴重程度的全面評估

MentalHealthBench 超越了以往主要聚焦於緊急情況的傳統評估方式。它利用保護隱私的合成對話,測試模型在三個不同嚴重程度層級上的表現:

  • 非緊急情況: 包含情緒成分的日常對話。
  • 高嚴重程度: 暗示顯著痛苦或嚴重心理健康問題,但非即時緊急狀況的對話。
  • 緊急情況: 涉及心理健康的緊急跡象或立即安全疑慮,需即時現實世界支援的對話。

該基準涵蓋多樣化的使用者角色,包括成人、青少年(13–17 歲)、照顧者與臨床專業人員,橫跨多種語言與地區,以捕捉不同的文化脈絡。

專家導向的評分標準與方法論

此基準由來自 22 個國家、超過 80 名持照心理學家與精神科醫師組成的全球團隊共同開發,涵蓋 19 種語言與近 20 種心理健康次專科領域。

評分機制

專家為每場合成對話制定了詳細的評分標準。每個標準的分數範圍為 -10 至 +10,正分代表有益行為,負分則懲罰有害行為。分數權重反映了該行為在特定情境下的臨床重要性。

驗證與評分

為確保可靠性,每場對話至少由三位專家審閱。僅當至少兩位專家同意且未被第三位專家反對時,該標準才會保留。最終評分由自動化評分系統 GPT-5.6 Sol 完成,該系統根據專家撰寫的評分標準評估模型回應。

模型表現與行為維度

對近期前沿模型的評估顯示,模型在處理心理健康情境方面持續進步。MentalHealthBench 可將總分分解為十個具體的模型行為維度,使研究人員能精準識別改進方向。例如,OpenAI 指出,先進模型適切尋求上下文的能力隨時間顯著提升。

使用者觀點 vs. 專家指導

OpenAI 另行進行了一項分析,涵蓋來自 16 個國家、14 種語言的 44 名成人,用以比較專家臨床指導與使用者偏好。分析結果揭示了兩者在優先事項上的差異:

  • 使用者偏好: 使用者更重視語氣與具體的下一步行動。
  • 專家指導: 專家強調收集相關上下文以及對模糊情境的謹慎解讀的重要性。

雖然基準的最終評分基於專家共識以維持臨床標準,但此分析提供了人工智慧支援所需品質的更完整圖像。

與安全生態系統的整合

MentalHealthBench 是 OpenAI 為提升敏感情境下人工智慧安全所推動的廣泛努力之一。這包括推出「可信聯絡人」功能,協助使用者在情緒低落時連結支援系統;推出「ChatGPT for Teens」並加強保護機制;以及擴展對本地化危機資源的存取。

Sources