Tencent-Hunyuan/HunyuanVideo-I2V

HunyuanVideo-I2V: A Customizable Image-to-Video Model based on HunyuanVideo

What it solves

HunyuanVideo-I2V 是一个图像到视频生成框架,允许用户从单一参考图像和文本提示创建高质量视频(最高 720p、129 帧)。它专门解决了在保持参考图像与生成视频第一帧之间视觉一致性的挑战,同时通过 LoRA 训练实现可定制的效果。

How it works

系统通过 token 替换技术将参考图像信息集成到 HunyuanVideo 架构中。它使用预训练的多模态大型语言模型(MLLM)——仅解码器(Decoder‑Only)架构作为文本编码器。MLLM 将输入图像处理为语义图像 token,然后与视频潜在 token 连接。这样模型能够在图像和文本两种模态之间执行全注意力计算,确保生成的视频在语义上与输入图像和说明保持一致。

Who it’s for

此工具面向 AI 研究者、开发者和创作者,帮助他们从静态图像生成电影级视频,也适用于希望通过 LoRA 训练自定义视频效果的用户。

Highlights

  • High Resolution: 支持最高 720p 分辨率的视频生成。
  • Visual Consistency: 优化以确保视频的第一帧忠实于参考图像。
  • Customizable Effects: 包含 LoRA 训练脚本,可创建特定视频效果(例如头发增长或拥抱)。
  • Parallel Inference: 通过 xDiT 支持多 GPU 序列并行推理,加快生成速度。
  • Flexible Dynamics: 提供配置,可在稳定视频生成和高动态运动之间切换。