PKU-YuanGroup/Helios
Helios: Real Real-Time Long Video Generation Model
解决的问题
Helios 解决了实时生成高质量分钟级长视频的挑战。它在保持强大连贯性和高推理速度的同时,消除了对复杂抗漂移策略(防止随时间产生的视觉不一致性)和标准加速技术的需求。
工作原理
Helios 是一个采用自回归方法、以 33 帧为块生成视频的 14B 参数视频生成模型。它采用基于金字塔的采样流水线和特定的优化来提高训练和推理吞吐量。该项目提供三个模型版本:Base(最高质量)、Mid(中间)和 Distilled(最高效率)。它还支持高级内存和计算优化,例如通过 group offloading 将 VRAM 使用量降低至约 6GB,以及用于多 GPU 扩展的上下文并行(例如 Ulysses、Ring 和 Unified Attention)。
适用对象
专为从事视频合成的 AI 研究人员和开发人员设计,他们需要在高质量长视频生成与可用硬件(从消费级 PC 到 H100 GPU)的实时性能之间取得平衡。
亮点
- 实时性能:在单块 H100 GPU 上实现高达 19.5 FPS 的性能。
- 长视频合成:能够生成分钟级视频,无需依赖传统的抗漂移方法。
- 内存效率:支持 group offloading,使模型仅需约 6GB VRAM 即可运行。
- 多模态支持:支持 text-to-video (T2V)、image-to-video (I2V) 和 video-to-video (V2V)。
- 广泛集成:对 Diffusers、SGLang-Diffusion、vLLM-Omni 和 Ascend-NPU 提供 Day-0 支持。
相关
- 项目
- 项目
- Dispatch
- 项目
- 项目