SANA-WM: 挑戰分鐘級世界建模的極限

追求高保真、長篇影片生成長期以來一直受到兩個主要障礙的困擾:計算成本和時間一致性。大多數現有的模型在維持超過幾秒鐘的連貫世界狀態時表現掙扎,通常會崩潰成視覺上的「slop」(雜訊)或失去對空間幾何的掌握。

SANA-WM 是 NVIDIA 推出的全新開源世界模型,旨在解決這些問題。透過將精簡的 2.6B 參數主幹網路與混合注意力機制相結合,SANA-WM 可以從單張圖像和相機軌跡生成 720p、長達一分鐘的影片,同時保持足夠的效率,使其能在單個 GPU 上運行。這代表了在讓世界模型變得易於研究,以及在機器人技術和遊戲領域進行潛在部署方面,邁出了重大的一步。

SANA-WM 的架構

SANA-WM 能夠生成長時程影片而不會產生 Transformer 常見的記憶體爆炸問題,這是由四個核心架構創新驅動的:

1. 混合線性注意力機制 (Hybrid Linear Attention)

傳統的 softmax attention 隨序列長度呈二次方增長,使得生成分鐘級影片在計算上變得極其昂貴。SANA-WM 使用了 Hybrid Linear Attention,它將逐幀的 Gated DeltaNet 與週期性的 softmax attention 相結合。這使得模型能夠在維持完整一分鐘連貫世界狀態的同時,保持緊湊的記憶體使用量,避免了困擾所有全 softmax 架構的「記憶體不足」(OOM) 錯誤。

2. 雙分支相機控制

為了實現精確的 6-DoF(六自由度)相機軌跡,該模型採用了雙分支系統:

  • Coarse Global Pose Branch: 處理相機的整體運動和方向。
  • Fine Pixel-Aligned Geometric Branch: 確保對公制相機路徑的高保真遵循,實現專業級的相機控制。

3. 兩階段生成流程

視覺品質透過兩階段流程進一步提升。在 2.6B 主幹網路生成初始的長時程 rollout 之後,會應用專用的 17B long-video refiner。這第二階段會銳化紋理、改善運動流暢度,並在「晚期視窗」(影片末端)維持品質,防止長 AI 生成序列中常見的典型退化現象。

4. 穩健的標註流程

高品質數據是任何世界模型的基石。團隊開發了一套流程,從公開影片中提取準確的公制尺度 6-DoF 相機位姿,為模型提供高品質、時空一致的動作標籤。這使得模型能夠在 15 天內,使用 64 台 H100 GPU,僅透過約 213K 個公開影片片段進行訓練。

效率與部署

SANA-WM 最令人矚目的主張之一是其精簡的計算配置。雖然訓練需要 H100 集群,但推理(inference)是為單個 GPU 設計的。

根據技術數據,該模型的蒸餾版本可以在單個 RTX 5090 上使用 NVFP4 量化技術,在僅 34 秒內完成 60 秒 720p 影片片段的去噪處理。這種吞吐量大約是先前具有同等視覺品質的開源基準模型的 36 倍。

社群觀點與評論

儘管取得了技術成就,SANA-WM 的發布在 Hacker News 的技術社群中引發了關於「世界模型」本質的細微辯論。

「意圖性」差距

一些評論家認為,雖然視覺效果令人驚艷,但這些模型缺乏人類設計環境中所具備的「意圖性」。

「我從影片遊戲的角度來看,很難理解這些世界模型... 在 FromSoftware 的遊戲中,通常不會有任何一個物品放錯位置... 我很難想像世界模型能達到捕捉這種意圖性的程度。」

這種評論指出,SANA-WM 創造了「閾限空間」(liminal spaces)——看起來正確但缺乏底層邏輯、物理學或生態系統,使其感覺起來像是一個活生生且有目的性的世界。

實用性與機器人技術

雖然有些人質疑生成高保真影片的長期實用性,很長遠來看,機器人技術將是主要受益者。機器人系統能夠透過構建模擬世界來「想像」動作的影響,這可以極大地加速在安全、合成環境中訓練自主代理(autonomous agents)的訓練過程。

「開源」爭議

與許多現代 AI 模型的發布一樣,最初對於「開源」標籤存在懷疑,用戶指出權重(weights)最初被列為「即將推出」。然而,隨後的社群發現顯示,該模型可以透過 Hugging Face 提供研究用途,並附帶用於權重的商業可用授權。

結論

SANA-WM 擴展了中小型參數模型所能實現的可能性。透過優化注意力機制並實量施展兩階段細化流程,NVIDIA 展示了分鐘級、高解析度影片生成並不一定需要在推理時使用龐大的、封閉源碼的工業級集群。無論這些模型最終是否能捕捉到設計世界的「靈魂」,還是僅僅作為高端視覺生成器,目前仍有待觀察,但其效率提升無疑是向前邁進的一步。

Sources