X-GenGroup/Flow-Factory
A unified framework for easy reinforcement learning in Flow-Matching models
解決的問題
Flow-Factory 是一個統一框架,旨在讓擴散模型與流匹配模型的強化學習(RL)更容易應用。它提供標準化的方式,透過使用各種 RL 算法與獎勵模型,對這些模型進行微調,以提升特定成果,例如美學品質、文字-影像對齊度,或文字渲染效果。
工作原理
此框架將模型與演算法分離,讓使用者能將多種 RL 技術應用於不同生成模型。支援彈性獎勵系統,可採用點對點(獨立評分)、成對(比較)或群組(基於排名)方式。使用者可整合內建獎勵模型(如 PickScore 或 CLIP),或透過 OpenAI 相容 API 連接到遠端 VLM-as-Judge 伺服器。
適用對象
適合希望透過 RL 微調,優化文字轉圖像、圖像轉圖像、文字轉影片,以及音訊-影片模型輸出品質的研究人員與開發者。
主要亮點
- 廣泛模型支援:相容多種模型,包括 FLUX、Stable Diffusion 3.5、Wan2.1 與 MiniMax H3。
- 多樣 RL 算法:實作 GRPO、DPO、DPPO 與 DiffusionNFT 等多種演算法。
- 多模態能力:支援圖像、影片以及同步音訊-影片內容的微調。
- 彈性獎勵系統:內建美學與對齊評分器,並支援複雜推理獎勵模型(如 RationalRewards)。
- 加速訓練:整合
torch.compile與多種注意力後端(Flash-Attention、xformers)以優化訓練效能。
相關
- 專案
- 專案
- 專案
- 專案
- 專案