chengzeyi/Comfy-WaveSpeed
https://wavespeed.ai/ [WIP] The all in one inference optimization solution for ComfyUI, universal, flexible, and fast.
解决的问题
Comfy-WaveSpeed 为 ComfyUI 提供了推理优化,减少了使用大型扩散模型生成图像和视频所需的时间和计算成本。它解决了 FLUX、SD3.5 和 HunyuanVideo 等高分辨率或复杂模型在本地推理时速度缓慢的问题。
工作原理
该项目实现了两种主要优化技术:
- 首块缓存(FBCache): 这种动态缓存算法使用第一个 Transformer 块的残差输出作为指标。如果当前与上一次残差输出的差异足够小,系统将重用上一次的最终残差输出,并跳过后续所有 Transformer 块的计算,从而可能将推理速度提升 1.5 倍至 3.0 倍。
- 增强的
torch.compile: 标准 PyTorch 编译过程的改进版本,可优化模型的执行图。与原始的TorchCompileModel节点不同,此版本支持 LoRA。
适用人群
在本地 GPU 上运行扩散模型的 ComfyUI 用户,希望在不显著降低图像或视频质量的前提下提升生成速度。
主要亮点
- 广泛模型支持: 支持 FLUX、LTXV、HunyuanVideo、SD3.5 和 SDXL。
- 显著提速: FBCache 可在保持高精度的同时实现高达 2 倍的加速。
- LoRA 兼容: 增强的编译节点支持 LoRA 模型的使用。
- 灵活配置: 用户可根据所用模型调整
residual_diff_threashold,在速度与质量之间取得平衡。
相关
- 项目
- 项目
- 项目
- 项目
- 项目