Helios:实时 14B 视频生成模型,实现高质量分钟级合成

它解决了什么

Helios 旨在解决实时生成高质量、长时长(分钟级)视频的挑战。它目标是提供比小模型更快且更省显存的模型,同时保持强连贯性和高质量,无需复杂的防漂移或加速技术。

工作原理

Helios 是一个拥有 14B 参数的视频生成模型,采用自回归方式,以 33 帧为一块生成视频。它使用多尺度采样管线(尤其在 Mid 和 Distilled 版本中)提升效率。项目包含针对训练和推理吞吐量的优化,支持组卸载(group offloading)以将显存使用降低至约 6GB,以及上下文并行(Ulysses、Ring、Unified 和 Ulysses Anything Attention)以实现多 GPU 扩展。

适用对象

它面向需要高吞吐、实时视频生成能力的 AI 视频合成开发者和研究者,同时也适用于希望在消费级硬件上生成高分辨率(最高可达 4K)视频的用户。

亮点

  • 实时性能:在单个 H100 GPU 上实现 19.5 FPS(在优化硬件上最高可达 20.89 FPS)。
  • 长视频连贯性:生成分钟级视频,无需依赖自强(self-forcing)或关键帧采样等标准防漂移策略。
  • 效率:在不使用 KV-cache 或量化等标准加速技术的情况下运行,仍然比许多 1.3B 模型更快。
  • 多功能性:支持文本到视频(T2V)、图像到视频(I2V)和视频到视频(V2V)任务。
  • 广泛兼容性:已集成 Diffusers、SGLang-Diffusion、vLLM-Omni 和 Ascend-NPU。

Sources