aigc-apps/VideoX-Fun
📹 A more flexible framework that can generate videos at any resolution and creates videos from images.
解决的问题
VideoX-Fun 提供了一个全面的高质 AI 视频和图像生成流水线。它解决了可控视频生成的挑战——允许用户指定起始和结束帧,使用参考视频进行风格迁移,或应用精确的结构控制(如 Canny 边缘、深度图或人体姿态)来引导生成内容的运动和构图。
工作原理
该项目采用扩散变换器(DiT)架构,特别支持 CogVideoX-Fun 和 Wan 2.1 系列模型。提供多种生成模式:
- 文本到视频 (T2V):从文本提示生成视频。
- 图像到视频 (I2V):使用一张或两张图像(起始帧和结束帧)来动画化场景。
- 视频到视频 (V2V):使用参考视频来引导生成新视频。
- 受控生成:使用控制模型强制执行特定条件,如 Canny、姿态、深度和 MLSD,以及相机运动控制(上下左右平移)。
为优化消费级 GPU 上的性能,实现了内存管理策略,包括 CPU 降载和 float8 量化。
适用人群
该工具专为希望对运动和风格有高度控制能力的 AI 艺术家、内容创作者和开发者设计。也适合希望训练自己基线或 LoRA 模型以实现特定风格转换的研究人员。
主要亮点
- 多模型支持:集成支持 CogVideoX-Fun 和 Wan 2.1 系列(1.3B 和 14B 模型)。
- 精确控制:支持相机轨迹控制和结构引导(Canny、深度、姿态)。
- 自定义训练:支持训练基线和 LoRA 模型,包括用于人类偏好优化的 Reward LoRA 支持。
- 灵活部署:可通过 ComfyUI、Docker 或直接 Python 脚本使用,支持 Windows 和 Linux。
相关
- 项目
- Dispatch
- 项目
- 项目
- 项目