Mengqi97/chinese-medical-dataset
Chinese Medical Dataset 致力于详细整理现有尽可能多的中文医学数据集,包括详细的数据汇总、数据示例、下载链接等。
解決的問題
本倉儲提供一個全面的開源中文醫療資料集集合與整理。它解決了醫療資料分散的問題,透過整合各類NLP任務(如醫療問答、實體識別、術語標準化、知識圖譜建構)的資源,使研究人員更容易找到高品質的資料用於訓練醫療AI。
如何運作
此專案作為一個經過篩選的目錄,按主要任務對各種醫療資料集進行分類。它為每個資料集提供詳細摘要,包括:
- 任務類型:如分類、醫療問答、實體識別或關係抽取。
- 資料量:訓練、驗證和測試樣本的數量。
- 下載連結:直接連結至Hugging Face、GitHub或雲端硬碟等來源。
- 資料範例:以JSON或表格形式展示實際的問題、答案和標籤結構的片段。
適用對象
- AI研究人員:正在開發大型語言模型(LLM)或醫療領域專用模型的人。
- 機器學習工程師:正在建構醫療聊天機器人、智慧診斷系統或醫療資訊抽取工具的人。
- 資料科學家:需要結構化中文醫療文字用於訓練或評估醫療AI模型的專業人士。
亮點
- 多樣化的任務覆蓋:包含醫療問答(如Huatuo-26M)、實體識別(如Yidu-S4K)和術語標準化(如Yidu-N7K)的資料集。
- 超大規模:包含超過2600萬筆高品質醫療問答對的Huatuo-26M資料集。
- 基準整合:包含用於評估中文醫療資訊處理的CBLUE基準。
- 專業領域覆蓋:涵蓋中醫、糖尿病研究、自閉症譜系障礙(AsdKB)等特定領域。
相關
- 專案
- 專案
- 專案
- 專案