提升 ChatGPT 的健康智能
提升 ChatGPT 的健康智能
GPT-5.5 Instant 推动健康智能的进步
OpenAI 推出了 GPT-5.5 Instant,这是一款显著提升 ChatGPT 处理健康与保健查询能力的模型。该模型在识别紧急护理需求、请求相关用户上下文、解释不确定性以及简化复杂健康信息方面取得了重大进展。
GPT-5.5 Instant 已向所有 ChatGPT 免费用户开放,扩大了对这些健康相关功能的访问。在最具挑战性的健康评估中,其表现已可与 OpenAI 前沿的 Thinking 模型相媲美。
衡量健康表现与准确性
OpenAI 使用专门针对健康的评估,以确保回复准确、易懂且基于良好判断。进展通过以下框架进行衡量:
评估框架
- HealthBench 和 HealthBench Professional:这些评估利用真实的健康对话和由医生编写的评分标准,评估准确性、安全性、沟通、上下文感知、完整性以及适当的升级。
- 由医生主导的比较:一组医生对比了 GPT-5.5 Instant 的 3,500 条回复与医生撰写的回复(医生拥有无限时间和互联网访问但未使用 AI)以及旧模型的回复。GPT-5.5 Instant 在所有指标上均获得更高评分,包括准确性、沟通、完整性、遵循指令以及健康决策的帮助性。
生产流量监控
为跟踪真实世界的表现,OpenAI 在生产流量上使用保护隐私的监控工具。对每周数十亿条信息的分析显示,包含至少一个标记事实错误的回复比例在过去两个月下降了 71%。
由医生主导的模型改进
GPT-5.5 Instant 的改进由遍布 60 个国家、使用 49 种语言、涵盖 26 个医学专科的全球 260 多名医生网络推动。该网络提供了在真实健康情境中定义“良好”回复所需的医学专业知识。
医生反馈的作用
- 回复审查:医生们审查了超过 70 万条示例模型回复,这些回复反映了患者和临床医生的真实使用情况。
- 评分标准制定:医生反馈用于创建评分标准和评估准则,帮助研究人员衡量回复是否准确、安全、清晰、完整且适度谨慎。
- 失效模式识别:GPT-5.5 Instant 的失效模式比之前的模型和人类医生更少,尤其在针对本地医疗环境定制回复、识别危险信号以及请求用户提供必要的额外上下文等方面表现更佳。
与更广泛的医疗工具集成
这些在通用健康智能方面的进展支持了 OpenAI 更广泛的医疗计划,包括面向临床医生的 ChatGPT for Clinicians 和 OpenAI for Healthcare 等专用工具,帮助医疗专业人员进行文档编写、研究和护理交付。