Helios:实时 14B 视频生成模型,实现高质量分钟级合成
它解决了什么
Helios 旨在解决实时生成高质量、长时长(分钟级)视频的挑战。它目标是提供比小模型更快且更省显存的模型,同时保持强连贯性和高质量,无需复杂的防漂移或加速技术。
工作原理
Helios 是一个拥有 14B 参数的视频生成模型,采用自回归方式,以 33 帧为一块生成视频。它使用多尺度采样管线(尤其在 Mid 和 Distilled 版本中)提升效率。项目包含针对训练和推理吞吐量的优化,支持组卸载(group offloading)以将显存使用降低至约 6GB,以及上下文并行(Ulysses、Ring、Unified 和 Ulysses Anything Attention)以实现多 GPU 扩展。
适用对象
它面向需要高吞吐、实时视频生成能力的 AI 视频合成开发者和研究者,同时也适用于希望在消费级硬件上生成高分辨率(最高可达 4K)视频的用户。
亮点
- 实时性能:在单个 H100 GPU 上实现 19.5 FPS(在优化硬件上最高可达 20.89 FPS)。
- 长视频连贯性:生成分钟级视频,无需依赖自强(self-forcing)或关键帧采样等标准防漂移策略。
- 效率:在不使用 KV-cache 或量化等标准加速技术的情况下运行,仍然比许多 1.3B 模型更快。
- 多功能性:支持文本到视频(T2V)、图像到视频(I2V)和视频到视频(V2V)任务。
- 广泛兼容性:已集成 Diffusers、SGLang-Diffusion、vLLM-Omni 和 Ascend-NPU。