Diffusers FLUX.2 集成
Hugging Face 已将 FLUX.2 集成到 Diffusers 库中,允许用户使用 Flux2Pipeline 运行高质量的文本到图像生成。此集成支持优化的模型变体,包括 4 位量化版本,以降低内存开销。
技术实现与管道
Diffusers 中的 FLUX.2 实现利用专门的管道和 transformer 模型来处理图像生成过程。管道的核心组件包括:
- Flux2Pipeline: 用于编排文本到图像过程的主要类。
- Flux2Transformer2DModel: 负责图像合成的模型架构。
- Mistral3ForConditionalGeneration: 用作文本编码器,将提示处理成 transformer 可理解的嵌入。
为了优化资源使用,该集成支持 torch.bfloat16 和 enable_model_cpu_offload(),在不使用时将模型组件移动到 CPU 以节省 GPU VRAM。
模型配置与使用
diffusers/FLUX.2-dev-bnb-4bit 仓库提供了模型的 4 位量化版本,这大幅降低了运行模型的硬件要求。
示例推理参数
在 Diffusers 中,FLUX.2 的典型推理设置使用以下参数:
- Inference Steps: 50 步(尽管 28 被指出是速度和质量的良好折衷)。
- Guidance Scale: 4.
- Precision:
torch.bfloat16。
库弃用
Hugging Face 已宣布 Flax 类现已弃用,并将在 Diffusers v1.0.0 中移除。建议用户迁移到 PyTorch 类或固定当前的 Diffusers 版本以保持兼容性。
内存注意事项
尽管使用了 4 位量化和 CPU 卸载,但模型仍然资源密集。技术日志表明,如果 GPU 容量不足以处理前向传播期间文本编码器和 transformer 的组合负载,则可能发生 CUDA OutOfMemory 错误。
Sources
- OriginalDiffusers welcomes FLUX-2