shibing624/MedicalGPT
MedicalGPT: Training Your Own Medical GPT Model with ChatGPT Training Pipeline. 训练医疗大模型,实现了包括增量预训练(PT)、有监督微调(SFT)、RLHF、DPO、ORPO、GRPO。
해결하는 문제
MedicalGPT는 의료 분야에 특화된 대규모 언어 모델(LLM)을 생성하기 위한 포괄적인 훈련 파이프라인을 제공합니다. 일반 목적의 LLM을 전문적인 의료 보조자로 변환하는 과정을 단순화하며, 초기 지식 주입부터 인간의 선호도 정렬에 이르기까지 훈련 라이프사이클의 모든 단계를 위한 도구를 제공합니다.
작동 방식
이 프로젝트는 ChatGPT 훈련 방법론을 기반으로 한 다단계 훈련 파이프라인을 구현합니다.
- 계속 사전 훈련 (PT): 막대한 의료 문서를 사용하여 도메인 특화 지식을 주입합니다.
- 교사 지도 미세 조정 (SFT): 검수된 질문-답변 쌍을 사용하여 모델의 지시 수행 행동을 정렬합니다.
- 정렬/선호도 최적화: 여러 사용 가능한 방법을 통해 모델 행동을 개선합니다:
- RLHF: 보상 모델링(RM)과 강화 학습(PPO/RLOO)의 두 단계 과정.
- DPO (직접 선호도 최적화): 별도의 보상 모델 없이 인간의 선호도를 기반으로 모델을 직접 최적화합니다.
- ORPO: SFT와 정렬을 하나의 단계로 통합하여 치명적인 망각을 줄입니다.
- GRPO: 규칙 기반 보상으로 추론 체인을 훈련합니다.
- OPD (정책 내 증류): 더 강력한 교사 모델로부터 지식을 증류합니다.
또한, 이 프로젝트는 에이전트 미세 조정을 지원하여, function_call과 observation과 같은 특정 역할을 대화 템플릿에 도입함으로써 모델이 함수 호출(도구 사용)을 학습할 수 있도록 합니다.
대상 사용자
- 전문적인 의료 LLM을 구축하고자 하는 AI 연구자 및 개발자.
- 자체 데이터셋에서 DPO, GRPO, RLHF와 같은 고급 정렬 기법을 구현하고자 하는 개발자.
- 외부 도구를 함수 호출을 통해 상호작용할 수 있는 의료 도메인 모델이 필요한 조직.
주요 특징
- 풀 라이프사이클 파이프라인: PT, SFT, RLHF, DPO, ORPO, GRPO, OPD를 모두 포함.
- 광범위한 모델 지원: Llama-3, Qwen-2.5, Mixtral 등과 호환.
- 에이전트 기능: 함수 호출을 학습할 수 있도록 내장된 지원 제공.
- 유연한 훈련: 하드웨어 제약에 따라 전체 파라미터 조정, LoRA, QLoRA를 지원.
- RAG 통합: 지식 기반 파일 기반의 검색 증강 생성(RAG)을 위한 ChatPDF 데모 포함.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트