MedGemma 與 MedSigLIP 發布說明
Google DeepMind 已透過發布 MedGemma 與 MedSigLIP,擴充其 Health AI Developer Foundations (HAI-DEF) 集合。這些開放模型為開發者提供了一個穩健、高效且保護隱私的起點,用於構建醫療應用程式,並允許對基礎設施和模型修改進行完全控制。
MedGemma: 健康領域的多模態生成模型
MedGemma 是一系列基於 Gemma 3 的生成模型,專為需要自由文本生成的任務設計,例如視覺問答和醫療報告生成。該系列包含 4B 和 27B 參數版本,兩者皆支援圖像和文字輸入。
MedGemma 4B 多模態
MedGemma 4B 已針對效率進行優化,並可調整以在行動硬體上運行。關鍵效能指標包括:
- MedQA Score: 64.4%,使其成為 8B 參數以下頂尖開放模型之一。
- Clinical Accuracy: 在一項未盲測研究中,其胸部 X 光報告有 81% 被美國認證放射科醫師判斷為準確度足夠,足以導致與原始報告相似的患者管理決策。
- Specialized Performance: 經過微調後,其在胸部 X 光報告生成上的 RadGraph F1 分數達到 30.3。
MedGemma 27B (文字與多模態)
MedGemma 27B 模型專為複雜的多模態和縱向電子健康記錄 (EHR) 解讀而設計。
- MedQA Performance: 文字版本得分 87.7%,僅落後 DeepSeek R1 約 3 分,同時推論成本僅約十分之一。
- Capabilities: 這些模型在檢索和解讀 EHR 數據方面與更大型模型具有競爭力。
MedSigLIP: 專門的醫療影像編碼器
MedSigLIP 是一個基於 Sigmoid loss for Language Image Pre-training (SigLIP) 架構的輕量級影像編碼器,參數量為 400M。其設計目的是透過將醫療影像和醫療文字編碼到共同的嵌入空間,來彌合醫療影像與醫療文字之間的差距。
技術適應與多功能性
MedSigLIP 透過使用多樣化的醫療影像資料進行調適而來自 SigLIP,包括眼底圖像、皮膚科圖像、病理切片和胸部 X 光。儘管經過此專門化,該模型在自然圖像上仍保持強大的效能。
主要使用案例
建議將 MedSigLIP 用於需要結構化輸出的影像任務,具體包括:
- Traditional Image Classification: 建構高效能的醫療影像分類器。
- Zero-shot Image Classification: 透過將影像嵌入與文字類別標籤嵌入進行比較,在無需特定訓練範例的情況下對影像進行分類。
- Semantic Image Retrieval: 在大型醫療資料庫中尋找在視覺或語義上相似的影像。
開放模型在醫療領域的優勢
Google DeepMind 強調,MedGemma 與 MedSigLIP 的開放特性相較於以 API 為基礎的模型,在醫療應用中提供了三項關鍵優勢:
- Flexibility and Privacy: 模型可部署在專有硬體上,無論是本地或 Google Cloud Platform,以符合機構的隱私政策。
- Customization: 開發者可進行微調,以針對特定目標任務和資料集優化模型效能。
- Reproducibility and Stability: 作為分發的快照,模型參數被凍結,確保輸出隨時間保持一致——這是醫療驗證的必要條件。
真實世界實作
早期採用者正在將這些模型用於各種臨床與研究應用:
- DeepHealth (USA): 正在探索使用 MedSigLIP 進行結節偵測與胸部 X 光分診。
- Chang Gung Memorial Hospital (Taiwan): 正在使用 MedGemma,因其在傳統中文醫療文獻與員工查詢方面的效果顯著。
- Tap Health (India): 正在應用 MedGemma 來摘要進展紀錄並提出符合指南的建議,這歸功於其卓越的醫療基礎。
部署與整合
MedGemma 與 MedSigLIP 提供 Hugging Face safetensors 格式。開發者可使用所提供的 GitHub 筆記本進行推理與微調,或透過 Vertex AI 將模型部署為專用端點。
免責聲明:MedGemma 與 MedSigLIP 是開發的起點,並非用於直接臨床使用。所有輸出都需要獨立驗證與臨床關聯;它們不應直接用於臨床診斷或患者管理決策。