Mengqi97/chinese-medical-dataset

Chinese Medical Dataset 致力于详细整理现有尽可能多的中文医学数据集,包括详细的数据汇总、数据示例、下载链接等。

何を解決するか

このリポジトリは、オープンソースの中国語医療データセットの包括的なコレクションと整理を提供します。医療データが散在している問題を解決し、医療QA、エンティティ認識、用語標準化、知識グラフ構築などのさまざまなNLPタスク向けのリソースを統合することで、研究者が高品質なデータを訓練用に見つけることを容易にします。

どう動くか

このプロジェクトは、主なタスク別にさまざまな医療データセットを分類するキュレートされたディレクトリとして機能します。各データセットについて、以下の詳細な要約を提供しています:

  • タスクタイプ:分類、医療QA、エンティティ認識、関係抽出など。
  • データ量:トレーニング、検証、テストサンプルの数。
  • ダウンロードリンク:Hugging Face、GitHub、クラウドストレージなどへの直接リンク。
  • データ例:実際の質問、回答、ラベルの構造を示すJSONまたはテーブル形式のスニペット。

対象ユーザー

  • AI研究者:大規模言語モデル(LLM)や医療分野向けの専門モデルを開発する人。
  • MLエンジニア:医療チャットボット、インテリジェント診断システム、医療情報抽出ツールを開発する人。
  • データサイエンティスト:医療AIモデルのトレーニングや評価に必要な構造化された中国語医療テキストを必要とする人。

特徴

  • 多様なタスクカバレッジ:医療QA(例:Huatuo-26M)、エンティティ認識(例:Yidu-S4K)、用語標準化(例:Yidu-N7K)向けのデータセットを含む。
  • 大規模スケール:2600万件以上の高品質な医療QAペアを含むHuatuo-26Mデータセット。
  • ベンチマーク統合:中国語医療情報処理の評価に使用されるCBLUEベンチマークを含む。
  • 専門分野:伝統的中国医学(TCM)、糖尿病研究、自閉症スペクトラム障害(AsdKB)など、特定の分野をカバー。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト