Helios:即時 14B 影片生成模型,用於高品質分鐘級合成

解決的問題

Helios 解決了即時生成高品質、長時長(分鐘級)影片的挑戰。它旨在提供一個比較小模型更快且更省記憶體的模型,同時保持強大的連貫性與品質,且不需要複雜的防漂移或加速技術。

工作原理

Helios 是一個擁有 14B 參數的影片生成模型,採用自回歸方式,將影片分成 33 幀的區塊生成。它使用多尺度抽樣管線(尤其在 Mid 與 Distilled 版本中)以提升效率。此專案包含訓練與推論吞吐量的最佳化,支援如群組卸載(group offloading)以將 VRAM 使用量降低至約 6GB,以及上下文平行化(Ulysses、Ring、Unified 與 Ulysses Anything Attention)以實現多 GPU 擴展。

目標使用者

它的設計對象是需要高吞吐量、即時影片生成能力的 AI 影片合成開發者與研究者,以及希望在消費級硬體上生成高解析度(最高 4K)影片的使用者。

重點特色

  • 即時效能:在單顆 H100 GPU 上達到 19.5 FPS(在最佳化硬體上可達 20.89 FPS)。
  • 長影片連貫性:生成分鐘級影片,無需依賴自強制或關鍵幀抽樣等標準防漂移策略。
  • 效率:在不使用 KV-cache 或量化等標準加速技術的情況下運行,仍比許多 1.3B 模型更快。
  • 多功能性:支援文字生成影片(Text-to-Video, T2V)、圖像生成影片(Image-to-Video, I2V)以及影片轉影片(Video-to-Video, V2V)任務。
  • 廣泛相容性:已整合 Diffusers、SGLang-Diffusion、vLLM-Omni 與 Ascend-NPU。

Sources