SandAI-org/MAGI-2-preview

MAGI-2-preview: Scaling Video Generation Models Efficiently

解决的问题

MAGI-2 Preview 旨在实现视频生成的有效扩展。它解决了从文本或图像提示生成具有同步音频的高分辨率 (1080p) 视频的挑战,同时通过使用混合专家 (MoE) 架构,在每个 token 时仅激活一小部分参数,从而优化了运行大规模模型 (114B 参数) 的计算成本。

工作原理

该模型采用两阶段生成过程:magi2_preview 阶段在低分辨率下对片段进行去噪,magi2_refiner 阶段将结果放大至 1080p。它支持文本转视频 (T2V) 和图像转视频 (I2V) 工作流。为了提高输出质量,它包含一个可选的提示词增强步骤,由 LLM 将简短的用户提示词重写为结构化、详细的描述。

适用对象

本项目面向拥有高端硬件(特别是 8 个 NVIDIA Hopper GPU)并希望生成带有集成音频的高质量 10 秒视频片段的研究人员和开发人员。

亮点

  • 统一音视频生成:同时生成视频和声音,并将其混音到单个输出文件中。
  • 高效扩展:利用 114B 参数模型,每个 token 仅激活 6B 参数。
  • 高分辨率:通过两阶段的“预览-精炼”流水线生成 1080p 视频。
  • 灵活输入:支持文本转视频和图像转视频生成。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目