SandAI-org/MAGI-2-preview
MAGI-2-preview: Scaling Video Generation Models Efficiently
解决的问题
MAGI-2 Preview 旨在实现视频生成的有效扩展。它解决了从文本或图像提示生成具有同步音频的高分辨率 (1080p) 视频的挑战,同时通过使用混合专家 (MoE) 架构,在每个 token 时仅激活一小部分参数,从而优化了运行大规模模型 (114B 参数) 的计算成本。
工作原理
该模型采用两阶段生成过程:magi2_preview 阶段在低分辨率下对片段进行去噪,magi2_refiner 阶段将结果放大至 1080p。它支持文本转视频 (T2V) 和图像转视频 (I2V) 工作流。为了提高输出质量,它包含一个可选的提示词增强步骤,由 LLM 将简短的用户提示词重写为结构化、详细的描述。
适用对象
本项目面向拥有高端硬件(特别是 8 个 NVIDIA Hopper GPU)并希望生成带有集成音频的高质量 10 秒视频片段的研究人员和开发人员。
亮点
- 统一音视频生成:同时生成视频和声音,并将其混音到单个输出文件中。
- 高效扩展:利用 114B 参数模型,每个 token 仅激活 6B 参数。
- 高分辨率:通过两阶段的“预览-精炼”流水线生成 1080p 视频。
- 灵活输入:支持文本转视频和图像转视频生成。
相关
- 项目
- 项目
- 项目
- 项目
- 项目