Junchao-cs/SolarWM

Open data and scalable training for long-horizon video world models.

它解决了什么问题

SolarWM 提供了一个全面的开源基础,用于创建交互式视频世界模型。它解决了在仅使用短训练片段(约5秒)的情况下,训练能够生成长时间跨度、相机控制的视频回放(持续几分钟到几小时)的模型的难题,同时保持与各种现有视频模型骨干架构的兼容性。

它如何工作

SolarWM 使用统一的数据基础设施,将数百万个视频片段处理为包含相机几何和字幕的标准化格式。然后采用三阶段训练方案,将双向视频模型转换为因果、自回归模型:

  1. 第0.5阶段(双向适应): 建立视频、文本和相机条件的基线表示。
  2. 第1阶段(教师强制AnyFlow): 结合教师强制与AnyFlow损失,学习去噪和有限步流映射,无需单独的ODE初始化。
  3. 第2阶段(分布匹配蒸馏): 使用自梯度强制(SGF)训练因果学生模型,利用冻结的教师模型和可训练的评判器对其自身回放进行训练。

适合谁

希望基于多样化的视频骨干模型(如 Wan2.2、LTX-2.5 和 MiniMax-H3)构建可扩展框架的研究人员和开发者,专注于视频生成、世界模型和交互式AI环境。

特色亮点

  • 骨干无关: 支持多种架构的5B–33B模型家族。
  • 长时程推理: 实现实时交互和持续几分钟到几小时的回放,无需长序列微调。
  • 开源数据流水线: 包含可重新配置的基础设施,支持来自14个数据集的143万条标准视频片段。
  • 简化训练: 采用简化的三阶段方案,避免复杂的ODE或一致性蒸馏初始化。

相关

  • 项目
  • 项目
  • 项目
  • 项目