Mengqi97/chinese-medical-dataset

Chinese Medical Dataset 致力于详细整理现有尽可能多的中文医学数据集,包括详细的数据汇总、数据示例、下载链接等。

해결하는 문제

이 저장소는 오픈소스 중국어 의료 데이터셋의 포괄적인 컬렉션과 정리된 목록을 제공합니다. 의료 데이터가 분산되어 있는 문제를 해결하기 위해, 의료 질의응답, 엔티티 인식, 용어 표준화, 지식 그래프 구축과 같은 다양한 NLP 작업을 위한 자원을 통합하여 연구자들이 의료 AI 모델을 훈련시키기 위한 고품질 데이터를 쉽게 찾을 수 있도록 합니다.

작동 방식

이 프로젝트는 주요 작업별로 다양한 의료 데이터셋을 분류하는 큐레이션된 디렉터리 역할을 합니다. 각 데이터셋에 대해 다음 정보를 제공합니다:

  • 작업 유형: 분류, 의료 QA, 엔티티 인식, 관계 추출 등.
  • 데이터 양: 학습, 검증, 테스트 샘플 수.
  • 다운로드 링크: Hugging Face, GitHub, 클라우드 드라이브 등 원본 위치로의 직접 링크.
  • 데이터 예시: 질문, 답변, 레이블의 실제 구조를 보여주는 JSON 또는 테이블 기반 스니펫.

대상 사용자

  • AI 연구자: 대규모 언어 모델(LLM) 또는 의료 분야 전용 모델을 개발하는 사람.
  • ML 엔지니어: 의료 챗봇, 지능형 진단 시스템, 의료 정보 추출 도구를 개발하는 사람.
  • 데이터 과학자: 의료 AI 모델의 훈련 또는 평가를 위해 구조화된 중국어 의료 텍스트가 필요한 사람.

주요 특징

  • 다양한 작업 커버리지: 의료 QA(예: Huatuo-26M), 엔티티 인식(예: Yidu-S4K), 용어 표준화(예: Yidu-N7K)를 위한 데이터셋 포함.
  • 엄청난 규모: 2,600만 개 이상의 고품질 의료 QA 쌍을 포함한 Huatuo-26M 데이터셋.
  • 벤치마크 통합: 중국어 의료 정보 처리 평가를 위한 CBLUE 벤치마크 포함.
  • 특화된 분야: 전통 중국 의학(TCM), 당뇨병 연구, 자폐 스펙트럼 장애(AsdKB) 등 특정 분야를 커버.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트