X-GenGroup/Flow-Factory

A unified framework for easy reinforcement learning in Flow-Matching models

解決的問題

Flow-Factory 是一個統一框架,旨在讓擴散模型與流匹配模型的強化學習(RL)更容易應用。它提供標準化的方式,透過使用各種 RL 算法與獎勵模型,對這些模型進行微調,以提升特定成果,例如美學品質、文字-影像對齊度,或文字渲染效果。

工作原理

此框架將模型與演算法分離,讓使用者能將多種 RL 技術應用於不同生成模型。支援彈性獎勵系統,可採用點對點(獨立評分)、成對(比較)或群組(基於排名)方式。使用者可整合內建獎勵模型(如 PickScore 或 CLIP),或透過 OpenAI 相容 API 連接到遠端 VLM-as-Judge 伺服器。

適用對象

適合希望透過 RL 微調,優化文字轉圖像、圖像轉圖像、文字轉影片,以及音訊-影片模型輸出品質的研究人員與開發者。

主要亮點

  • 廣泛模型支援:相容多種模型,包括 FLUX、Stable Diffusion 3.5、Wan2.1 與 MiniMax H3。
  • 多樣 RL 算法:實作 GRPO、DPO、DPPO 與 DiffusionNFT 等多種演算法。
  • 多模態能力:支援圖像、影片以及同步音訊-影片內容的微調。
  • 彈性獎勵系統:內建美學與對齊評分器,並支援複雜推理獎勵模型(如 RationalRewards)。
  • 加速訓練:整合 torch.compile 與多種注意力後端(Flash-Attention、xformers)以優化訓練效能。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案