Waypoint-1: 即時互動視頻擴散模型來自 Overworld
Overworld 已推出 Waypoint-1,這是一個即時互動視頻擴散模型,使用戶能夠透過文字提示、滑鼠移動和鍵盤輸入進入並互動與生成的世界。與傳統僅透過有限控制微調預訓練視頻模型的世界模型不同,Waypoint-1 從零開始設計用於互動體驗,提供零延遲控制,並能在消費級硬體上運行。
模型架構與訓練
Waypoint-1 是一種基於幀因果修正流變換器的潛在模型。它是在一個包含 10,000 小時多樣化遊戲畫面的數據集上進行訓練的,該數據集的畫面伴隨文本標籤和控制輸入。
訓練方法
為了實現其互動能力,Waypoint-1 使用了兩個主要的訓練階段:
- 擴散強制: 該模型使用擴散強制進行預訓練,其中它學會在給定過去幀的情況下去噪未來幀。因果注意力遮罩確保幀內的標記僅關注其自身幀或之前的幀,從而在推理過程中允許程序化生成新幀。
- 自強制: 為了解決由預訓練期間隨機噪聲導致的推理不匹配和誤差累積(噪聲長時間推出),模型透過 DMD 進行了後訓練的自強制。此技術使訓練 regime 與推理行為對齊,實現單通過 CFG 和少步驟去噪。
WorldEngine 推理庫
Overworld 發布了 WorldEngine,這是一個高效能的 Python 推理庫,專為低延遲、高吞吐量的互動世界模型串流而設計。WorldEngine 消耗上下文幀、文字以及鍵盤/滑鼠輸入,以即時輸出圖像幀。
效能基準
在 NVIDIA RTX 5090 上運行 Waypoint-1-Small (2.3B 參數) 模型時,WorldEngine 達成以下效能:
- 吞吐量:大約每秒 30,000 次 token 傳遞(基於每幀 256 個 token 的單次去噪傳遞)。
- 幀率:在 4 步去噪時為 30 FPS,或在 2 步去噪時為 60 FPS。
技術優化
WorldEngine 的效能由四項特定優化驅動:
- AdaLN 特徵快取:在提示條件和時間步在前向傳遞間保持不變時,快取並重複使用 AdaLN 條件投影。
- 靜態滾動 KV 快取 + Flex Attention:實施先進的快取和注意力機制以減少冗餘計算。
- 矩陣乘法融合:使用融合的 QKV 投影來優化矩陣乘法。
- Torch 編譯:使用 `torch.compile(fullgraph=True, mode=