Junchao-cs/SolarWM

Open data and scalable training for long-horizon video world models.

它解決的問題

SolarWM 提供了一個全面的開源基礎架構,用於建立互動式視頻世界模型。它解決了訓練能夠生成長時程、可控制相機的視頻滾動(持續數分鐘至數小時)模型的困難,同時僅使用短訓練片段(約 5 秒),並與各種現有的視頻模型主幹保持相容。

如何運作

SolarWM 使用統一的資料基礎設施,將數百萬個視頻片段轉換為包含相機幾何與字幕的標準化格式。接著,它採用三階段訓練方案,將雙向視頻模型轉換為因果、自回歸模型:

  1. 階段 0.5(雙向適應): 建立視頻、文字與相機條件的基礎表示。
  2. 階段 1(教師強制 AnyFlow): 將教師強制與 AnyFlow 損失結合,學習去噪與有限步驟的流映射,無需額外的 ODE 初始化。
  3. 階段 2(分佈匹配蒸餾): 使用自梯度強制(SGF)訓練一個因果學生模型,使其在固定教師與可訓練評估器的協助下,對自身的滾動進行訓練。

適用對象

致力於視頻生成、世界模型與互動式 AI 環境的研究人員與開發者,希望有一個可擴展的框架,能基於 Wan2.2、LTX-2.5 和 MiniMax-H3 等多樣化的視頻主幹進行開發。

特色亮點

  • 主幹無關: 支援多種架構的 5B–33B 模型家族。
  • 長時程推論: 支援即時互動與持續數分鐘至數小時的滾動,無需長序列微調。
  • 開源資料流程: 包含可重新配置的基礎設施,整合來自 14 個資料集的 143 萬個標準化片段。
  • 簡化訓練: 經優化的三階段訓練流程,避免複雜的 ODE 或一致性蒸餾初始化。

相關

  • 專案
  • 專案
  • 專案
  • 專案