X-GenGroup/Flow-Factory

A unified framework for easy reinforcement learning in Flow-Matching models

解决的问题

Flow-Factory 是一个统一框架,旨在使扩散模型和流匹配模型的强化学习(RL)更易于使用。它提供了一种标准化的方法,通过使用各种 RL 算法和奖励模型,对这些模型进行微调,以提升特定结果,例如美学质量、文本-图像对齐度或文本渲染效果。

工作原理

该框架将模型与算法解耦,使用户能够将多种 RL 技术应用于不同的生成模型。它支持灵活的奖励系统,可采用点对点(独立评分)、成对(比较)或分组(基于排名)的方式。用户可以集成内置的奖励模型(如 PickScore 或 CLIP),或通过 OpenAI 兼容 API 连接到远程 VLM-as-Judge 服务器。

适用人群

适用于希望使用 RL 微调来优化文本到图像、图像到图像、文本到视频以及音视频模型输出质量的研究人员和开发者。

主要亮点

  • 广泛模型支持:兼容多种模型,包括 FLUX、Stable Diffusion 3.5、Wan2.1 和 MiniMax H3。
  • 多样 RL 算法:实现了 GRPO、DPO、DPPO 和 DiffusionNFT 等多种算法。
  • 多模态能力:支持图像、视频以及同步音视频内容的微调。
  • 灵活奖励系统:内置美学和对齐评分器,并支持复杂推理奖励模型(如 RationalRewards)。
  • 加速训练:集成 torch.compile 和多种注意力后端(Flash-Attention、xformers)以优化训练性能。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目