X-GenGroup/Flow-Factory
A unified framework for easy reinforcement learning in Flow-Matching models
解决的问题
Flow-Factory 是一个统一框架,旨在使扩散模型和流匹配模型的强化学习(RL)更易于使用。它提供了一种标准化的方法,通过使用各种 RL 算法和奖励模型,对这些模型进行微调,以提升特定结果,例如美学质量、文本-图像对齐度或文本渲染效果。
工作原理
该框架将模型与算法解耦,使用户能够将多种 RL 技术应用于不同的生成模型。它支持灵活的奖励系统,可采用点对点(独立评分)、成对(比较)或分组(基于排名)的方式。用户可以集成内置的奖励模型(如 PickScore 或 CLIP),或通过 OpenAI 兼容 API 连接到远程 VLM-as-Judge 服务器。
适用人群
适用于希望使用 RL 微调来优化文本到图像、图像到图像、文本到视频以及音视频模型输出质量的研究人员和开发者。
主要亮点
- 广泛模型支持:兼容多种模型,包括 FLUX、Stable Diffusion 3.5、Wan2.1 和 MiniMax H3。
- 多样 RL 算法:实现了 GRPO、DPO、DPPO 和 DiffusionNFT 等多种算法。
- 多模态能力:支持图像、视频以及同步音视频内容的微调。
- 灵活奖励系统:内置美学和对齐评分器,并支持复杂推理奖励模型(如 RationalRewards)。
- 加速训练:集成
torch.compile和多种注意力后端(Flash-Attention、xformers)以优化训练性能。
相关
- 项目
- 项目
- 项目
- 项目
- 项目