chengzeyi/Comfy-WaveSpeed

https://wavespeed.ai/ [WIP] The all in one inference optimization solution for ComfyUI, universal, flexible, and fast.

解决的问题

Comfy-WaveSpeed 为 ComfyUI 提供了推理优化,减少了使用大型扩散模型生成图像和视频所需的时间和计算成本。它解决了 FLUX、SD3.5 和 HunyuanVideo 等高分辨率或复杂模型在本地推理时速度缓慢的问题。

工作原理

该项目实现了两种主要优化技术:

  1. 首块缓存(FBCache): 这种动态缓存算法使用第一个 Transformer 块的残差输出作为指标。如果当前与上一次残差输出的差异足够小,系统将重用上一次的最终残差输出,并跳过后续所有 Transformer 块的计算,从而可能将推理速度提升 1.5 倍至 3.0 倍。
  2. 增强的 torch.compile 标准 PyTorch 编译过程的改进版本,可优化模型的执行图。与原始的 TorchCompileModel 节点不同,此版本支持 LoRA。

适用人群

在本地 GPU 上运行扩散模型的 ComfyUI 用户,希望在不显著降低图像或视频质量的前提下提升生成速度。

主要亮点

  • 广泛模型支持: 支持 FLUX、LTXV、HunyuanVideo、SD3.5 和 SDXL。
  • 显著提速: FBCache 可在保持高精度的同时实现高达 2 倍的加速。
  • LoRA 兼容: 增强的编译节点支持 LoRA 模型的使用。
  • 灵活配置: 用户可根据所用模型调整 residual_diff_threashold,在速度与质量之间取得平衡。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目