Tencent-Hunyuan/HunyuanVideo-1.5

HunyuanVideo-1.5: A leading lightweight video generation model

What it solves

HunyuanVideo-1.5 是一個輕量級的影片生成模型,旨在提供高品質的影片合成,同時降低開發者與創作者的計算門檻。它能在消費級 GPU 上產生專業等級的影片,解決了在不需要龐大工業硬體的情況下,仍能有效且高解析度地創作影片的需求。

How it works

此專案使用 83 億參數的 Diffusion Transformer(DiT)結合 3D 因果 VAE 以實現高效的空間與時間壓縮。它採用 Selective and Sliding Tile Attention(SSTA)機制來剪除冗餘資料並加速推論。為了進一步提升品質,還加入了影片超解析度(VSR)網路,將輸出升級至 1080p。模型支援文字轉影片(T2V)與圖像轉影片(I2V)生成,並可透過 step‑distillation 進一步優化以加快生成速度。

Who it’s for

此模型適用於開發者、AI 研究者與數位創作者,讓他們能在最低 14GB GPU 記憶體的可及硬體上產生高品質影片,並可透過 ComfyUI 或 Diffusers 等工具將影片生成整合至自家應用中。

Highlights

  • Consumer-Grade Accessibility: 在 NVIDIA GPU 上只需 14GB VRAM 即可運行,並支援模型卸載。
  • High-Performance Architecture: 使用 SSTA 在 720p 影片合成上實現顯著加速。
  • Flexible Generation: 支援文字轉影片與圖像轉影片的多種解析度工作流程。
  • Advanced Optimizations: 包含 FP8 GEMM、快取推論(DeepCache、TeaCache、TaylorCache)以及 step‑distilled 模型以快速生成。
  • Super-Resolution: 內建少步驟網路將影片升級至 1080p,提升銳利度與紋理。