Helios: 高品質な分単位合成のためのリアルタイム14Bビデオ生成モデル
Heliosが解決する課題
Helios は、リアルタイムで高品質かつ長時間(分単位)のビデオを生成するという課題に取り組みます。小規模モデルよりも高速でメモリ効率が高く、複雑なアンチドリフトやアクセラレーション手法を必要とせずに、強い一貫性と品質を維持するモデルの提供を目指しています。
仕組み
Helios は 14B パラメータのビデオ生成モデルで、自己回帰的アプローチを用いて 33 フレームのチャンクでビデオを生成します。特に Mid と Distilled バージョンでマルチスケールサンプリングパイプラインを採用し、効率を向上させています。プロジェクトはトレーニングと推論のスループット向上のための最適化を含み、グループオフロードによって VRAM 使用量を約 6GB に削減する機能や、マルチ GPU スケーリングのためのコンテキスト並列化(Ulysses、Ring、Unified、Ulysses Anything Attention)をサポートしています。
対象ユーザー
本モデルは、高スループットかつリアルタイムのビデオ生成機能を必要とする AI ビデオ合成の開発者や研究者、そして消費者向けハードウェアで 4K までの高解像度ビデオを生成したいユーザー向けに設計されています。
ハイライト
- リアルタイム性能: 単一の H100 GPU で 19.5 FPS を達成(最適化ハードウェアでは最大 20.89 FPS)。
- 長時間ビデオの一貫性: 自己強制やキーフレームサンプリングといった標準的なアンチドリフト手法に依存せず、分単位のビデオを生成。
- 効率性: KV キャッシュや量子化といった標準的なアクセラレーション手法を使用せずに動作しながら、多くの 1.3B モデルよりも高速。
- 汎用性: Text-to-Video (T2V)、Image-to-Video (I2V)、Video-to-Video (V2V) タスクをサポート。
- 広範な互換性: Diffusers、SGLang-Diffusion、vLLM-Omni、Ascend-NPU と統合。