开放医学-LLM 排行榜:在医疗领域对大型语言模型进行基准评估

Hugging Face 已推出开放医学-LLM 排行榜,这是一个标准化平台,旨在评估并比较大型语言模型(LLM)在多种医学任务上的表现。该倡议解决了医疗领域对特定领域基准测试的迫切需求,因为模型输出的错误可能对患者护理和治疗结果产生严重后果。

评估框架与数据集

开放医学-LLM 排行榜使用准确率作为主要评估指标,以衡量模型在多个专业医学问答数据集上提供正确答案的比例:

MedQA

MedQA 包含来自美国医学执照考试(USMLE)的多项选择题,用于评估获得美国医学执照所需的医学知识和推理能力。开发集包含 11,450 道题,测试集包含 1,273 道题。

MedMCQA

MedMCQA 源自印度医学入学考试(AIIMS/NEET),是一个覆盖 2.4k 医疗主题和 21 个医学学科的大规模数据集。开发集超过 187,000 道题,测试集 6,100 道题。

PubMedQA

PubMedQA 是一个封闭域问答数据集,包含 1,000 对专家标注的样本。模型必须基于相关的 PubMed 摘要给出 yes/no/maybe 的答案,以测试对科学生物医学文献的理解与推理能力。

MMLU 子集

排行榜使用了 Measuring Massive Multitask Language Understanding(MMLU)基准的特定子集来评估专业领域:

  • 临床知识: 265 道关于临床决策的问题。
  • 医学遗传学: 100 道问题。
  • 解剖学: 135 道问题。
  • 专业医学: 272 道问题。
  • 大学生物学: 144 道问题。
  • 大学医学: 173 道问题。

关键洞察与模型分析

对多种模型的评估显示,商业模型与开源模型之间存在性能差距,尽管一些体积较小的模型仍具竞争力:

  • 商业主导: GPT-4-base 和 Med-PaLM-2 在各类医学数据集上始终保持最高准确率。
  • 开源竞争力: 参数约为 70 亿的模型,如 Starling-LM-7B、gemma-7b、Mistral-7B-v0.1 和 Hermes-2-Pro-Mistral-7B,在特定任务上表现出竞争力。
  • 共同优势: 商业模型和开源模型在应用临床知识(MMLU Clinical Knowledge)以及对生物医学文献进行推理(PubMedQA)方面均表现良好。
  • Gemini Pro 表现: Gemini Pro 在数据密集型和程序化任务(如生物统计学、细胞生物学、产科与妇科)上表现突出,但在解剖学、心脏病学和皮肤科方面表现中等偏低。

模型提交要求

要在排行榜上进行评估,研究者必须确保模型满足以下技术条件:

  1. Safetensors 格式: 模型权重必须转换为 safetensors,以实现更安全、更快速的加载。
  2. AutoClasses 兼容性: 模型和分词器必须能够使用 Transformers 库中的 AutoConfigAutoModelAutoTokenizer 类进行加载。
  3. 公开访问: 模型必须公开可获取,私有模型无法进行评估。

目前,排行榜尚不支持需要 use_remote_code=True 的模型,相关功能正在开发中。

未来路线图

开放医学-LLM 排行榜计划扩展其范围,涵盖:

  • 多样化数据集: 通过行业和研究合作,引入放射学、病理学和基因组学等领域的数据。
  • 高级指标: 超越单纯的准确率,探索点对点评分(Pointwise scores)以及其他更能体现医学应用独特需求的领域特定指标。

Sources