dc-ai-projects/DC-Gen
DC-Gen: Post-Training Diffusion Acceleration with Deeply Compressed Latent Space
解决的问题
DC-Gen 解决了现代视觉扩散模型计算成本高、吞吐量低的问题,这使得高分辨率(例如 4K)图像和视频生成在训练和推理时间方面变得极为昂贵。
工作原理
DC-Gen 是一种加速框架,可将预训练的扩散模型迁移到一个深度压缩的潜在空间中。它使用一种称为 嵌入对齐(Embedding Alignment) 的技术,将基础模型的知识迁移到新的潜在空间,使模型能够在无需从头重新训练扩散模型权重的情况下生成具有正确语义的视觉内容。通过少量端到端微调或 LoRA 微调步骤即可恢复完整质量。
适用人群
需要在推理阶段实现显著加速,并能够在不承担原始基础模型巨大开销的前提下生成高分辨率图像和视频的扩散模型开发者和研究人员。
主要亮点
- 巨大加速:在 H100 GPU 上,对于 FLUX.1-Krea 等模型,在 4K 分辨率下实现最高 53.8 倍的推理加速。
- 多功能应用:支持文本到图像(1K 和 4K)、文本到视频、图像到视频,以及基于指令的图像编辑。
- 高效适配:无需完整模型重训练,即可快速适配自动编码器。
- 高质量输出:在大幅减少 token 冗余的同时,保持基础模型的真实感和文本渲染能力。
相关
- 项目
- 项目
- 项目
- 项目
- 项目