shengshu-ai/minWM

A Minimal and Elegant Framework & Tutorial for Real-Time Interactive World Models

解決的問題

minWM 提供了一個完整的開源流程,用於建立動作條件化的影片世界模型。它簡化了將標準的雙向文字轉影片(T2V)基礎模型轉換為可回應特定動作或相機軌跡的即時互動式世界模型的複雜過程。

如何運作

此框架實作多階段蒸餾流程,將基礎模型轉化為高效、少步數的自回歸(AR)學生模型。該流程包含兩個主要階段:

  1. 階段 1:雙向 SFT - 初始監督微調。
  2. 階段 2:蒸餾 - 包含教師強制 AR 擴散、因果 ODE/CD(因果強制/因果強制++)以及非對稱 DMD 與自我滾動的三階段流程,以實現 4 步即時推論。

支援多種骨幹,特別是 Wan 2.1HunyuanVideo 1.5,並可使用 ProPE 等方法注入條件(如相機姿態)。

適用對象

專為研究生、獨立研究者以及初級實驗室設計,幫助他們無需從零開始逆向工程現有倉儲即可建構影片世界模型。

主要亮點

  • 全棧流程:涵蓋從資料建構與處理到訓練與推論的全部流程。
  • 多骨幹支援:相容 Wan 2.1 與 HunyuanVideo 1.5 架構。
  • 即時推論:將模型蒸餾為 4 步 DMD 推論流程,實現快速生成。
  • LLM 輔助入門:包含「Claude 技能」,協助使用者除錯訓練失敗並整合新模型骨幹。
  • 相機控制:支援透過姿態字串或 JSON 檔案實現精確的相機軌跡控制。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案