shengshu-ai/minWM
A Minimal and Elegant Framework & Tutorial for Real-Time Interactive World Models
解决的问题
minWM 提供了一个完整的开源流水线,用于创建动作条件化的视频世界模型。它简化了将标准双向文本到视频(T2V)基础模型转换为可响应特定动作或相机轨迹的实时交互式世界模型的复杂过程。
工作原理
该框架实现了一个多阶段蒸馏过程,将基础模型转化为高效、少步数的自回归(AR)学生模型。该流水线包含两个主要阶段:
- 阶段 1:双向 SFT - 初始监督微调。
- 阶段 2:蒸馏 - 包含教师强制 AR 扩散、因果 ODE/CD(因果强制/因果强制++)以及非对称 DMD 与自回放的三阶段过程,实现 4 步实时推理。
支持多种骨干网络,特别是 Wan 2.1 和 HunyuanVideo 1.5,并可使用 ProPE 等方法注入条件(如相机位姿)。
适用人群
专为研究生、独立研究者以及初级实验室设计,帮助他们无需从零开始逆向工程现有仓库即可构建视频世界模型。
主要亮点
- 全栈流水线:涵盖从数据构建与处理到训练和推理的全部流程。
- 多骨干支持:兼容 Wan 2.1 和 HunyuanVideo 1.5 架构。
- 实时推理:将模型蒸馏为 4 步 DMD 推理流程,实现快速生成。
- LLM 辅助入门:包含「Claude 技能」,帮助用户调试训练失败并集成新模型骨干。
- 相机控制:支持通过姿态字符串或 JSON 文件实现精确的相机轨迹控制。
相关
- 项目
- 项目
- 项目
- 项目
- 项目