Mengqi97/chinese-medical-dataset

Chinese Medical Dataset 致力于详细整理现有尽可能多的中文医学数据集,包括详细的数据汇总、数据示例、下载链接等。

解决的问题

本仓库提供了一个全面的开源中文医疗数据集集合与整理。它解决了医疗数据分散的问题,通过整合各类NLP任务(如医疗问答、实体识别、术语标准化、知识图谱构建)的资源,使研究人员更容易找到高质量的数据用于训练医疗AI。

如何工作

该项目作为一个经过筛选的目录,按主要任务对各种医疗数据集进行分类。它为每个数据集提供详细摘要,包括:

  • 任务类型:如分类、医疗问答、实体识别或关系抽取。
  • 数据量:训练、验证和测试样本的数量。
  • 下载链接:直接链接到Hugging Face、GitHub或云盘等来源。
  • 数据示例:以JSON或表格形式展示实际的问题、答案和标签结构的片段。

适用人群

  • AI研究人员:正在开发大语言模型(LLM)或医疗领域专用模型的人。
  • 机器学习工程师:正在构建医疗聊天机器人、智能诊断系统或医疗信息抽取工具的人。
  • 数据科学家:需要结构化中文医疗文本用于训练或评估医疗AI模型的专业人士。

亮点

  • 多样化的任务覆盖:包含医疗问答(如Huatuo-26M)、实体识别(如Yidu-S4K)和术语标准化(如Yidu-N7K)的数据集。
  • 超大规模:包含超过2600万条高质量医疗问答对的Huatuo-26M数据集。
  • 基准集成:包含用于评估中文医疗信息处理的CBLUE基准。
  • 专业领域覆盖:涵盖中医、糖尿病研究、自闭症谱系障碍(AsdKB)等特定领域。

相关

  • 项目
  • 项目
  • 项目
  • 项目