X-GenGroup/Flow-Factory
A unified framework for easy reinforcement learning in Flow-Matching models
해결하는 문제
Flow-Factory는 확산 모델과 플로우 매칭 모델에 대한 강화학습(RL)을 더 쉽게 만들기 위해 설계된 통합 프레임워크입니다. 다양한 RL 알고리즘과 보상 모델을 사용하여 미적 품질, 텍스트-이미지 일치도, 텍스트 렌더링 등 특정 결과를 향상시키기 위해 이러한 모델을 표준화된 방식으로 미세 조정할 수 있도록 지원합니다.
작동 방식
이 프레임워크는 모델과 알고리즘을 분리하여, 사용자가 다양한 생성 모델에 다양한 RL 기법을 적용할 수 있도록 합니다. 점별(독립된 점수), 쌍별(비교), 그룹별(랭킹 기반)의 유연한 보상 시스템을 지원합니다. 내장된 보상 모델인 PickScore 또는 CLIP를 사용할 수 있으며, OpenAI 호환 API를 통해 원격 VLM-as-Judge 서버에 연결할 수도 있습니다.
대상 사용자
텍스트-이미지, 이미지-이미지, 텍스트-비디오, 오디오-비디오 모델의 출력 품질을 RL 미세 조정을 통해 최적화하고자 하는 생성형 AI 연구자 및 개발자에게 적합합니다.
주요 특징
- 광범위한 모델 지원: FLUX, Stable Diffusion 3.5, Wan2.1, MiniMax H3 등 다양한 모델과 호환됩니다.
- 다양한 RL 알고리즘: GRPO, DPO, DPPO, DiffusionNFT 등 수많은 알고리즘을 구현했습니다.
- 다중 모달 기능: 이미지, 비디오, 동기화된 오디오-비디오 콘텐츠의 미세 조정을 지원합니다.
- 유연한 보상 시스템: 내장된 미적 및 일치도 스코어링 기능과 복잡한 추론 기반 보상 모델(RationalRewards 등)을 지원합니다.
- 가속화:
torch.compile및 여러 어텐션 백엔드(Flash-Attention, xformers)와 통합되어 트레이닝을 최적화합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트