Mengqi97/chinese-medical-dataset
Chinese Medical Dataset 致力于详细整理现有尽可能多的中文医学数据集,包括详细的数据汇总、数据示例、下载链接等。
解决的问题
本仓库提供了一个全面的开源中文医疗数据集集合与整理。它解决了医疗数据分散的问题,通过整合各类NLP任务(如医疗问答、实体识别、术语标准化、知识图谱构建)的资源,使研究人员更容易找到高质量的数据用于训练医疗AI。
如何工作
该项目作为一个经过筛选的目录,按主要任务对各种医疗数据集进行分类。它为每个数据集提供详细摘要,包括:
- 任务类型:如分类、医疗问答、实体识别或关系抽取。
- 数据量:训练、验证和测试样本的数量。
- 下载链接:直接链接到Hugging Face、GitHub或云盘等来源。
- 数据示例:以JSON或表格形式展示实际的问题、答案和标签结构的片段。
适用人群
- AI研究人员:正在开发大语言模型(LLM)或医疗领域专用模型的人。
- 机器学习工程师:正在构建医疗聊天机器人、智能诊断系统或医疗信息抽取工具的人。
- 数据科学家:需要结构化中文医疗文本用于训练或评估医疗AI模型的专业人士。
亮点
- 多样化的任务覆盖:包含医疗问答(如Huatuo-26M)、实体识别(如Yidu-S4K)和术语标准化(如Yidu-N7K)的数据集。
- 超大规模:包含超过2600万条高质量医疗问答对的Huatuo-26M数据集。
- 基准集成:包含用于评估中文医疗信息处理的CBLUE基准。
- 专业领域覆盖:涵盖中医、糖尿病研究、自闭症谱系障碍(AsdKB)等特定领域。
相关
- 项目
- 项目
- 项目
- 项目