Tencent-Hunyuan/HunyuanVideo-I2V

HunyuanVideo-I2V: A Customizable Image-to-Video Model based on HunyuanVideo

What it solves

HunyuanVideo-I2V 是一個影像到影片生成框架,允許使用者從單一參考圖像與文字提示產生高品質影片(最高 720p、129 幀)。它特別解決了在保持參考圖像與生成影片第一幀之間視覺一致性的挑戰,同時支援透過 LoRA 訓練自訂效果。

How it works

系統透過 token 替換技術將參考圖像資訊整合至 HunyuanVideo 架構中。它使用預訓練的多模態大型語言模型(MLLM)— 只解碼器(Decoder‑Only)架構作為文字編碼器。MLLM 會將輸入圖像轉換為語意圖像 token,然後與影片潛在 token 連接。這使模型能在圖像與文字兩種模態之間執行全注意力計算,確保生成的影片在語意上與輸入圖像與說明保持一致。

Who it’s for

此工具設計給 AI 研究者、開發者與創作者使用,讓他們能從靜態圖像生成電影級影片,亦適合想要透過 LoRA 訓練自訂影片效果的人。

Highlights

  • High Resolution: 支援最高 720p 解析度的影片生成。
  • Visual Consistency: 優化以確保影片的第一幀忠實於參考圖像。
  • Customizable Effects: 包含 LoRA 訓練腳本,可創建特定影片效果(例如頭髮生長或擁抱)。
  • Parallel Inference: 透過 xDiT 支援多 GPU 序列平行推論,加速生成速度。
  • Flexible Dynamics: 提供設定,可在穩定影片生成與高動態運動之間切換。