MedGemma 和 MedSigLIP 发布说明
Google DeepMind 通过发布 MedGemma 和 MedSigLIP,扩展了其健康 AI 开发者基础(HAI-DEF)集合。这些开放模型为开发者提供了构建医疗保健应用的稳健、高效且保护隐私的起点,使其能够完全控制基础设施和模型修改。
MedGemma: 多模态生成模型(健康)
MedGemma 是一系列基于 Gemma 3 的生成模型,专为需要自由文本生成的任务而设计,例如视觉问答和医学报告生成。该系列包括 4B 和 27B 参数变体,两者均支持图像和文本输入。
MedGemma 4B 多模态
MedGemma 4B 经过效率优化,可适配在移动硬件上运行。关键性能指标包括:
- MedQA 分数:64.4%,使其成为 8B 参数以下的顶尖开放模型之一。
- 临床准确性:在一项未盲法研究中,其胸部 X 光报告的 81% 被美国认证的放射科医生判断为准确度足够,能够产生与原始报告相似的患者管理。
- 专项性能:微调后,其在胸部 X 光报告生成上的 RadGraph F1 得分达到 30.3。
MedGemma 27B(文本和多模态)
MedGemma 27B 模型专为复杂的多模态和纵向电子健康记录(EHR)解释而设计。
- MedQA 性能:文本变体得分 87.7%,使其与 DeepSeek R1 的差距在 3 分以内,同时推理成本仅约为十分之一。
- 能力:这些模型在 EHR 数据的检索和解释方面与更大的模型具有竞争力。
MedSigLIP: 专用医疗影像编码器
MedSigLIP 是一个基于 Sigmoid 损失的 Language Image Pre-training (SigLIP) 架构的轻量级图像编码器,参数量为 400M。它通过将医学图像和医学文本编码到共同的嵌入空间来弥合两者之间的差距。
技术适配与多功能
MedSigLIP 通过在多样化的医学影像数据上进行调优而从 SigLIP 适配而来,这些数据包括眼底图像、皮肤科图像、病理学切片和胸部 X 光。尽管进行了这种专门化,该模型在自然图像上仍保持强大的性能。
主要用例
MedSigLIP 推荐用于需要结构化输出的影像任务,具体包括:
- 传统图像分类:构建高性能的医学图像分类器。
- 零样本图像分类:通过将图像嵌入与文本类别标签嵌入进行比较来对图像进行分类,无需特定的训练示例。
- 语义图像检索:在大型医学数据库中查找在视觉或语义上相似的图像。
开放模型在医疗中的优势
Google DeepMind 强调,MedGemma 和 MedSigLIP 的开放特性相较于基于 API 的模型在医疗应用中提供了三个关键优势:
- 灵活性和隐私:模型可以在专有硬件上部署,也可以本地或在 Google Cloud Platform 上部署,以满足机构的隐私政策。
- 定制:开发者可以微调模型,以针对特定目标任务和数据集优化性能。
- 可重复性和稳定性:作为分发的快照,模型参数被冻结,确保输出随时间保持一致——这是医学验证的要求。
实际应用
早期采用者正在将这些模型用于各种临床和研究应用:
- DeepHealth (美国): 正在探索使用 MedSigLIP 进行结节检测和胸部 X 光分诊。
- 长庚纪念医院 (台湾): 正在使用 MedGemma,因其在传统中文医学文献和员工查询方面的有效性。
- Tap Health (印度): 正在应用 MedGemma 来总结进展记录并提出符合指南的干预措施,这是因为其具有卓越的医学基础。
部署与集成
MedGemma 和 MedSigLIP 以 Hugging Face safetensors 格式提供。开发者可以使用提供的 GitHub 笔记本进行推理和微调,或通过 Vertex AI 将模型部署为专用端点。
免责声明:MedGemma 和 MedSigLIP 是开发的起点,不打算用于直接临床使用。所有输出都需要独立验证和临床关联;它们不应直接用于临床诊断或患者管理决策。