shibing624/MedicalGPT
MedicalGPT: Training Your Own Medical GPT Model with ChatGPT Training Pipeline. 训练医疗大模型,实现了包括增量预训练(PT)、有监督微调(SFT)、RLHF、DPO、ORPO、GRPO。
何を解決するか
MedicalGPTは、医療分野に特化した大規模言語モデル(LLM)を作成するための包括的なトレーニングパイプラインを提供します。医療業界に特化したモデルの開発を簡素化し、汎用LLMを専門的な医療アシスタントに変換するプロセスを、初期の知識注入から人間の好みの整合まで、すべての段階でツールを提供します。
仕組み
このプロジェクトは、ChatGPTのトレーニング手法に基づいたマルチステージのトレーニングパイプラインを実装しています。
- 継続的事前学習(PT): 大規模な医療文書を用いてドメイン固有の知識を注入します。
- 教師あり微調整(SFT): 検証済みの質問・回答ペアを使用して、モデルの指示従い行動を調整します。
- 整合性/好み最適化: 複数の方法を用いてモデルの振る舞いを最適化します:
- RLHF: モデル評価(RM)と強化学習(PPO/RLOO)の2段階プロセス。
- DPO(直接好み最適化): 別の報酬モデルを必要とせず、人間の好みに基づいてモデルを直接最適化します。
- ORPO: SFTと整合性を1ステップで統合し、深刻な忘却を軽減します。
- GRPO: ルールベースの報酬を使用して推論チェーンを訓練します。
- OPD(ポリシー内蒸留): より強力な教師モデルから知識を蒸留します。
さらに、このプロジェクトはエージェント微調整をサポートしており、function_callやobservationといった特定の役割を会話テンプレートに導入することで、モデルが関数呼び出し(ツール使用)を学習できるようにしています。
対象ユーザー
- 専門的な医療LLMの構築を目指すAI研究者および開発者。
- 自分のデータセット上でDPO、GRPO、RLHFなどの高度な整合技術を実装したい開発者。
- 外部ツールとの関数呼び出しによる対話が可能な医療分野モデルを必要とする組織。
特徴
- フルライフサイクルパイプライン: PT、SFT、RLHF、DPO、ORPO、GRPO、OPDをカバー。
- 広範なモデル対応: Llama-3、Qwen-2.5、Mixtralなどに対応。
- エージェント機能: 関数呼び出しを学習するための組み込みサポート。
- 柔軟なトレーニング: ハードウェア制約に応じて、全パラメータチューニング、LoRA、QLoRAをサポート。
- RAG統合: 知識ベースファイルに基づく検索拡張生成(RAG)用のChatPDFデモを含む。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト