OpenAI 推出 MentalHealthBench
OpenAI 推出了 MentalHealthBench,这是一个开源基准测试工具,旨在衡量人工智能系统在应对现实心理健康对话时的表现。该工具使研究人员和开发者能够评估模型在各种场景下的表现,确保人工智能的回应符合专家临床指导,同时优先考虑用户的安全与福祉。
跨严重程度的全面评估
MentalHealthBench 超越了以往主要关注紧急情况的传统评估方式。它利用保护隐私的合成对话,在三个不同严重程度级别上测试模型:
- 非紧急情况: 包含情感成分的日常对话。
- 高严重程度: 表明存在显著困扰或严重心理健康问题,但并非立即紧急的情况。
- 紧急情况: 包含心理健康危机迹象或需要紧急现实支持的即时安全问题的对话。
该基准测试涵盖了多样化的用户角色,包括成年人、青少年(13-17岁)、照顾者和临床医生,覆盖多种语言和地区,以捕捉不同的文化背景。
专家驱动的评分标准与方法论
该基准测试由来自22个国家、代表19种语言和近20个心理健康亚专科的80多名持证心理学家和精神科医生全球团队共同开发。
评分机制
专家为每条合成对话制定了详细的评分标准。每个标准的权重范围为 -10 到 +10,正分奖励有益行为,负分惩罚有害行为。权重反映了该行为在特定情境下的临床重要性。
验证与评分
为确保可靠性,每条对话至少由三位专家评审。只有在至少两位专家达成一致且未被第三位专家反驳的情况下,标准才会被保留。最终评估由自动化评分器 GPT-5.6 Sol 执行,该系统根据专家撰写的评分标准评估模型回应。
模型表现与行为维度
对近期前沿模型的评估显示,模型在应对心理健康情境方面持续进步。MentalHealthBench 可将总分分解为十个具体的行为维度,使研究人员能够精准识别改进方向。例如,OpenAI 指出,先进模型在适当地获取上下文方面的能力随着时间推移已显著提升。
用户视角与专家指导的对比
OpenAI 还开展了一项独立分析,涉及来自16个国家、使用14种语言的44名成年人,用以比较专家临床指导与用户偏好。该分析揭示了优先事项的差异:
- 用户偏好: 用户更重视语气和实际的下一步行动建议。
- 专家指导: 专家强调收集相关背景信息以及对模糊情境的谨慎解读的重要性。
尽管基准测试的最终评分基于专家共识以维持临床标准,但此项分析为理想的人工智能支持应具备的特质提供了更全面的图景。
与安全生态系统的整合
MentalHealthBench 是 OpenAI 在敏感情境下提升人工智能安全性的更广泛努力的一部分。这包括推出「可信联系人」功能,帮助用户在情绪困扰时连接支持系统;发布「ChatGPT for Teens」并增强保护措施;以及扩大对本地危机资源的访问权限。
Sources
- OriginalIntroducing MentalHealthBench