Tencent-Hunyuan/HunyuanVideo-I2V
HunyuanVideo-I2V: A Customizable Image-to-Video Model based on HunyuanVideo
What it solves
HunyuanVideo-I2V は画像から動画への生成フレームワークで、単一の参照画像とテキストプロンプトから高品質な動画(最大 720p、129 フレーム)を作成できます。参照画像と生成された動画の最初のフレーム間の視覚的一貫性を保つ課題に特化し、LoRA トレーニングによるカスタマイズ可能なエフェクトも提供します。
How it works
システムはトークン置換技術を用いて参照画像情報を HunyuanVideo アーキテクチャに統合します。事前学習済みのマルチモーダル大規模言語モデル(MLLM)を Decoder‑Only アーキテクチャのテキストエンコーダとして使用します。MLLM は入力画像を意味的画像トークンに変換し、これを動画潜在トークンと連結します。これにより、画像とテキストの両モーダル間でフルアテンション計算が可能となり、生成された動画が入力画像とキャプションと意味的に整合するようになります。
Who it’s for
このツールは、静止画像からシネマティックな動画を生成したい AI 研究者、開発者、クリエイター、そして LoRA を用いてカスタム動画エフェクトを訓練したい人向けです。
Highlights
- High Resolution: 最大 720p の動画生成をサポート。
- Visual Consistency: 動画の最初のフレームが参照画像に忠実になるよう最適化。
- Customizable Effects: LoRA 訓練スクリプトを含み、特定の動画エフェクト(例:髪の成長や抱擁)を作成可能。
- Parallel Inference: xDiT を使用したマルチ GPU シーケンス並列推論に対応し、生成速度を向上。
- Flexible Dynamics: 安定した動画生成と高ダイナミックな動きの切り替え設定を提供。