agentscope-ai/Trinity-RFT

Trinity-RFT is a general-purpose, flexible and scalable framework designed for reinforcement fine-tuning (RFT) of large language models (LLM).

해결하는 문제

Trinity-RFT는 대규모 언어 모델(LLM)의 강화 학습 미세조정(RFT)을 위한 통합적이고 유연한 프레임워크를 제공합니다. 경험 생성, 모델 업데이트, 데이터 관리를 분리함으로써 강화 학습을 통해 LLM의 능력을 향상시키는 과정을 단순화합니다.

작동 방식

이 프레임워크는 세 가지 핵심 구성 요소로 구성됩니다:

  • Explorer: 에이전트-환경 상호작용을 처리하여 경험 데이터를 생성합니다.
  • Trainer: 수집된 데이터를 기반으로 손실을 최소화하여 모델 가중치를 업데이트합니다.
  • Buffer: RFT 라이프사이클 전반에 걸쳐 데이터 처리, 정제, 증강을 담당하는 데이터 파이프라인을 관리합니다.

동기/비동기, 온폴리시/오프폴리시, 온라인/오프라인 RL을 포함한 다양한 RFT 모드를 지원하며, 롤아웃과 트레이닝을 장치 간에 독립적으로 확장할 수 있습니다.

대상 사용자

  • 특정 도메인용 LLM 기반 에이전트를 훈련하고자 하는 에이전트 애플리케이션 개발자.
  • 플러그 앤 플레이 모듈을 사용해 새로운 RL 알고리즘을 구현하고 검증하고자 하는 강화 학습 연구자.
  • RFT 데이터셋 생성 및 인간-중개 시나리오를 포함한 복잡한 데이터 파이프라인 구축에 집중하는 데이터 엔지니어.

주요 특징

  • 에이전트 기반 RL 지원: AgentScope와 같은 프레임워크로 개발된 다단계 워크플로우를 포함한 에이전트 애플리케이션을 직접 훈련 가능.
  • 포괄적인 알고리즘 지원: PPO, GRPO, DPO, SFT 및 CHORD, REC와 같은 특수한 변형을 포함한 다양한 알고리즘을 구현.
  • 전 생애주기 데이터 파이프라인: 우선순위 지정, 정제 기능을 갖춘 활성 데이터 관리 및 다중 작업 공동 학습의 네이티브 지원 제공.
  • 유연한 배포: VLM 훈련, LoRA, 그리고 로컬 GPU가 없는 사용자를 위한 Tinker 백엔드를 지원.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트