開放醫療大型語言模型排行榜:醫療領域大型語言模型基準測試
Hugging Face 已推出開放醫療大型語言模型排行榜,這是一個標準化平台,旨在評估與比較大型語言模型(LLMs)在各種醫療任務上的表現。此計畫回應了醫療領域對於領域特定基準測試的迫切需求,因為模型輸出不準確可能對患者護理與治療結果造成嚴重後果。
評估框架與資料集
開放醫療大型語言模型排行榜以準確率作為主要評估指標,衡量模型在多個專業醫療問答資料集上提供正確答案的比例:
MedQA
MedQA 包含來自美國醫師執照考試(USMLE)的多項選擇題,評估取得美國醫師執照所需的醫學知識與推理能力。開發集有 11,450 題,測試集有 1,273 題。
MedMCQA
MedMCQA 取材自印度醫學入學考試(AIIMS/NEET),是一個大型資料集,涵蓋 2.4k 醫療主題與 21 個醫學科目。開發集超過 187,000 題,測試集有 6,100 題。
PubMedQA
PubMedQA 是一個封閉領域的問答資料集,包含 1,000 組專家標註的問答對。模型必須根據相關的 PubMed 摘要給出是/否/可能的答案,以測試對科學生物醫學文獻的理解與推理能力。
MMLU 子集
排行榜使用 Measuring Massive Multitask Language Understanding(MMLU)基準的特定子集來評估專業領域:
- 臨床知識: 265 題,涉及臨床決策。
- 醫學遺傳學: 100 題。
- 解剖學: 135 題。
- 專業醫學: 272 題。
- 大學生物學: 144 題。
- 大學醫學: 173 題。
主要洞見與模型分析
對各模型的評估顯示商業模型與開源模型之間存在性能差距,儘管某些較小的模型仍具競爭力:
- 商業主導: GPT-4-base 與 Med-PaLM-2 在各醫療資料集上持續取得最高準確率。
- 開源競爭力: 參數約 70 億的模型,如 Starling-LM-7B、gemma-7b、Mistral-7B-v0.1 與 Hermes-2-Pro-Mistral-7B,在特定任務上表現具競爭力。
- 共同優勢: 商業與開源模型皆在應用臨床知識(MMLU Clinical Knowledge)與推理生物醫學文獻(PubMedQA)方面表現良好。
- Gemini Pro 表現: 雖然 Gemini Pro 在資料密集與程序性任務(如生物統計、細胞生物學與產科與婦科)上表現優異,但在解剖學、心臟學與皮膚科方面則呈現中等至較低的表現。
模型提交要求
欲在排行榜上接受評估,研究人員必須確保其模型符合以下技術條件:
- Safetensors 格式: 模型權重必須轉換為 safetensors,以提升載入的安全性與速度。
- AutoClasses 相容性: 模型與分詞器必須能使用 Transformers 套件中的
AutoConfig、AutoModel與AutoTokenizer類別載入。 - 公開存取: 模型必須公開可取得,私有模型無法接受評估。
目前,排行榜不支援需要 use_remote_code=True 的模型,該功能仍在開發中。
未來路線圖
開放醫療大型語言模型排行榜計畫擴大範圍,納入以下內容:
- 多元資料集: 透過產業與研究合作,納入放射學、病理學與基因組學的資料。
- 進階指標: 超越單純的準確率,探索 Pointwise 分數與其他領域特定指標,以更好地捕捉醫療應用的獨特需求。