Diffusers FLUX.2 集成

Hugging Face 已将 FLUX.2 集成到 Diffusers 库中,允许用户使用 Flux2Pipeline 运行高质量的文本到图像生成。此集成支持优化的模型变体,包括 4 位量化版本,以降低内存开销。

技术实现与管道

Diffusers 中的 FLUX.2 实现利用专门的管道和 transformer 模型来处理图像生成过程。管道的核心组件包括:

  • Flux2Pipeline: 用于编排文本到图像过程的主要类。
  • Flux2Transformer2DModel: 负责图像合成的模型架构。
  • Mistral3ForConditionalGeneration: 用作文本编码器,将提示处理成 transformer 可理解的嵌入。

为了优化资源使用,该集成支持 torch.bfloat16enable_model_cpu_offload(),在不使用时将模型组件移动到 CPU 以节省 GPU VRAM。

模型配置与使用

diffusers/FLUX.2-dev-bnb-4bit 仓库提供了模型的 4 位量化版本,这大幅降低了运行模型的硬件要求。

示例推理参数

在 Diffusers 中,FLUX.2 的典型推理设置使用以下参数:

  • Inference Steps: 50 步(尽管 28 被指出是速度和质量的良好折衷)。
  • Guidance Scale: 4.
  • Precision: torch.bfloat16

库弃用

Hugging Face 已宣布 Flax 类现已弃用,并将在 Diffusers v1.0.0 中移除。建议用户迁移到 PyTorch 类或固定当前的 Diffusers 版本以保持兼容性。

内存注意事项

尽管使用了 4 位量化和 CPU 卸载,但模型仍然资源密集。技术日志表明,如果 GPU 容量不足以处理前向传播期间文本编码器和 transformer 的组合负载,则可能发生 CUDA OutOfMemory 错误。

Sources