Tencent-Hunyuan/HunyuanVideo-1.5
HunyuanVideo-1.5: A leading lightweight video generation model
What it solves
HunyuanVideo-1.5 是一个轻量级的视频生成模型,旨在提供高质量的视频合成,同时降低开发者和创作者的计算门槛。它能够在消费级 GPU 上生成专业级视频,解决了在不需要庞大工业硬件的情况下,高效、高分辨率视频创作的需求。
How it works
项目使用 83 亿参数的 Diffusion Transformer(DiT)结合 3D 因果 VAE,实现高效的空间和时间压缩。它采用 Selective and Sliding Tile Attention(SSTA)机制来裁剪冗余数据并加速推理。为了进一步提升质量,还加入了视频超分辨率(VSR)网络,将输出放大至 1080p。模型支持文本到视频(T2V)和图像到视频(I2V)生成,并可通过 step‑distillation 进一步优化以加快生成速度。
Who it’s for
该模型面向开发者、AI 研究者和数字创作者,让他们能够在最低 14GB GPU 内存的可及硬件上生成高质量视频,并可通过 ComfyUI 或 Diffusers 等工具将视频生成集成到自己的应用中。
Highlights
- Consumer-Grade Accessibility: 在 NVIDIA GPU 上只需 14GB VRAM 即可运行,支持模型卸载。
- High-Performance Architecture: 使用 SSTA 在 720p 视频合成上实现显著加速。
- Flexible Generation: 支持文本到视频和图像到视频的多分辨率工作流。
- Advanced Optimizations: 包含 FP8 GEMM、缓存推理(DeepCache、TeaCache、TaylorCache)以及 step‑distilled 模型以快速生成。
- Super-Resolution: 内置少步网络将视频提升至 1080p,提升清晰度和纹理。