OpenAI HealthBench 发布

OpenAI 推出了 HealthBench,这是一套新评估框架,旨在衡量 AI 系统在真实健康场景中的能力。该框架与来自 60 个国家的 262 位医生合作开发,HealthBench 提供了一种严格、以医生为基础的方法,用于评估 AI 模型是否能够提供安全且有用的健康信息。

HealthBench 数据集与方法论

HealthBench 包含 5,000 条真实的、多轮的、多语言的健康对话。这些情景模拟 AI 模型与个人用户或临床医生之间的互动,涵盖各种医学专科和情境。该数据集通过合成生成与人工对抗测试相结合的方式开发,以确保示例足够困难且能代表真实世界的使用情况。

基于评分标准的评估

与传统的考试式基准不同,HealthBench 使用基于评分标准的评分系统。每段对话都配有由医生定制的评分标准,包含模型回复必须满足或避免的具体准则。

  • 规模与细节: 该基准包含 48,562 条独特的评分标准准则。
  • 权重: 每条准则根据医生对其重要性的判断分配分值。
  • 评分过程: 基于模型的评分器(GPT-4.1)评估每条评分标准是否满足,模型根据获得的总分相对于最高可能分数获得整体得分。

组织结构

HealthBench 将评估划分为七个主题(如紧急情况和全球健康)以及多个维度,定义模型行为的评估方面,例如准确性、沟通质量或情境寻求。

模型性能与基准

OpenAI 对多个代际的模型进行了评估,发现近期的前沿模型在性能、成本和可靠性方面都有快速提升。

前沿性能

近期的 OpenAI 模型,特别是 o3,优于其他前沿模型,包括 Claude 3.7 Sonnet 和 Gemini 2.5 Pro(2025 年 3 月)。OpenAI 报告称,其前沿模型在最近几个月中在 HealthBench 上提升了 28%。

成本与可及性

更新的模型已经改变了性能-成本的前沿。例如,GPT-4.1 nano 的表现优于 2024 年 8 月的 GPT-4o 模型,同时成本低 25 倍。数据表明,推理模型(o3、o4-mini、o1)随着测试时计算资源的增加而持续改进。

可靠性与错误率

为应对医疗保健中对可靠性的关键需求,OpenAI 引入了基准的两种专门变体:

  • HealthBench Consensus: 一个包含 3,671 条示例的子集,其准则经过多次医生共识验证。与 GPT-4o 相比,o3 和 GPT-4.1 在此子集上的错误率显著降低。
  • HealthBench Hard: 一个包含 1,000 条示例的子集,当前前沿模型在此表现困难,旨在为未来的开发提供目标。

与人类医生基准的比较

OpenAI 将模型回复与医生撰写的专家回复进行比较,以建立临床基准。

  • 2024 年 9 月模型: 医生在获取 o1-preview 和 GPT-4o 的回复后能够改进这些回复,表明医生仍能在这些模型之上提供价值。
  • 2025 年 4 月模型: 在 o3 和 GPT-4.1 的实验中,医生获取模型回复后已无法提升回复质量,这表明这些新模型已达到或超过专家临床判断的性能水平,在这些特定基准情景中。

可信度与验证

为验证基于模型的评分器,OpenAI 进行“元评估”,将评分器的结果与医生对 HealthBench Consensus 中回复的审查进行比较。结果显示,模型评分器与医生之间的两两一致性与医生之间的个人一致性相似。

可用性

HealthBench 包括评估套件和底层数据,已在 OpenAI 的 GitHub 仓库中公开提供,以支持更广泛的研究社区开发有益于人类健康的 AI 系统。

Sources