Tencent-Hunyuan/HunyuanVideo-1.5
HunyuanVideo-1.5: A leading lightweight video generation model
What it solves
HunyuanVideo-1.5 は、開発者やクリエイターの計算負荷を下げつつ高品質な動画合成を提供することを目的とした軽量動画生成モデルです。コンシューマー向け GPU でもプロフェッショナルレベルの動画を生成でき、巨大な産業用ハードウェアを必要とせずに効率的で高解像度な動画制作が可能になります。
How it works
本プロジェクトは、83 億パラメータの Diffusion Transformer(DiT)と 3D 因果 VAE を組み合わせ、空間・時間圧縮を効率化しています。Selective and Sliding Tile Attention(SSTA)メカニズムにより冗長データを削減し、推論を高速化。さらに品質向上のために、出力を 1080p にアップスケールする動画超解像(VSR)ネットワークを搭載しています。モデルはテキストから動画(T2V)と画像から動画(I2V)の両方に対応し、ステップ蒸留により生成速度をさらに最適化できます。
Who it’s for
最低 14GB の GPU メモリを搭載したハードウェアで高品質な動画を生成したい開発者、AI 研究者、デジタルクリエイター向けです。また、ComfyUI や Diffusers といったツールを通じて、独自アプリケーションへの動画生成統合を目指す方にも適しています。
Highlights
- Consumer-Grade Accessibility: NVIDIA GPU 上で 14GB VRAM だけで動作し、モデルオフロードに対応。
- High-Performance Architecture: SSTA を利用し、720p 動画合成で大幅な高速化を実現。
- Flexible Generation: テキストから動画、画像から動画の様々な解像度ワークフローをサポート。
- Advanced Optimizations: FP8 GEMM、キャッシュ推論(DeepCache、TeaCache、TaylorCache)およびステップ蒸留モデルに対応し、迅速な生成が可能。
- Super-Resolution: 数ステップのネットワークで動画を 1080p にアップスケールし、鮮明さとテクスチャを向上させます。