dc-ai-projects/DC-Gen
DC-Gen: Post-Training Diffusion Acceleration with Deeply Compressed Latent Space
解決的問題
DC-Gen 解決了現代視覺擴散模型計算成本高、吞吐量低的問題,這使得高解析度(例如 4K)圖像與影片生成在訓練與推論時間上變得極其昂貴。
工作原理
DC-Gen 是一種加速框架,可將預訓練的擴散模型遷移至深度壓縮的潛在空間。它使用一種稱為 嵌入對齊(Embedding Alignment) 的技術,將基礎模型的知識遷移至新的潛在空間,使模型能在無需從頭重新訓練擴散模型權重的情況下生成具有正確語義的視覺內容。透過少量端到端微調或 LoRA 微調步驟即可恢復完整品質。
適用對象
需要在推論階段實現顯著加速,並能在不承擔原始基礎模型巨大開銷的前提下生成高解析度圖像與影片的擴散模型開發者與研究人員。
主要亮點
- 巨大加速:在 H100 GPU 上,對於 FLUX.1-Krea 等模型,在 4K 解析度下實現最高 53.8 倍的推論加速。
- 多功能應用:支援文字到圖像(1K 與 4K)、文字到影片、圖像到影片,以及基於指令的圖像編輯。
- 高效適配:無需完整模型重訓練,即可快速適配自動編碼器。
- 高品質輸出:在大幅減少 token 冗餘的同時,保持基礎模型的真實感與文字渲染能力。
相關
- 專案
- 專案
- 專案
- 專案
- 專案