SANA-WM: オープンソースのワールドモデリングにおける1分の壁を打破する
一貫性のある長尺ビデオ生成の探求は、長らく「メモリの壁」に悩まされてきました。これは、時間的な一貫性を維持するための計算コストが、利用可能なGPUメモリを超えてしまうという問題です。現在のほとんどのモデルは、シーンが溶け始めたり、ドリフトしたりする前に、数秒間以上の安定した世界を維持することに苦労しています。
NVIDIAの新しいオープンソースのワールドモデルであるSANA-WMは、この制限を打ち破ることを目指しています。2.6Bの軽量なパラメータアーキテクチャとハイブリッドアテンションメカニズムを組み合わせることで、SANA-WMは単一のGPU上で展開可能な状態を保ちながら、1分間続く720pのビデオを合成できます。これは、オープンソースコミュニティにとって、効率性とアクセシビリティにおける大きな飛躍を意味します。
効率性のアーキテクチャ
高解像度のビデオを1分間生成するには、膨大な量のコンテキストが必要です。SANA-WMは、主に4つのアーキテクチャ上の革新を通じてこれを実現します。
1. ハイブリッド線形アテンション
標準的なsoftmax attentionに伴う二次的なメモリ増大を避けるため、SANA-WMはHybrid Linear Attentionシステムを利用しています。これは、フレームごとのGated DeltaNet(再帰的な線形アテンションメカニズム)と、周期的なsoftmax attentionを組み合わせたものです。これにより、モデルはGPUをクラッシュさせることなく、長いスパンにわたって一貫した「世界の状態」を維持することができ、通常は大規模な産業用クラスター用に予約されている分単位のロールアウトを可能にします。
2. デュアルブランチ・カメラコントロール
ワールドモデリングにおける最も困難な問題の一つは、環境を歪ませることなく、カメラが特定のパスに従うようにすることです。SANA-WMは、Dual-Branch Camera Controlシステムを採用しています。
- Coarse Global Pose Branch: 一般的な軌跡を扱います。
- Fine Pixel-Aligned Geometric Branch: メトリックなカメラパスへの高忠実度な追従を保証します。 これにより、精密な6-DoF(6自由度)制御が可能になり、単一の画像と軌跡から、制御可能なシネマティックなシーケンスへと変えることができます。
3. 2段階生成パイプライン
速度と品質のバランスをとるため、モデルは段階的なアプローチを使用します。最初の段階では、長いロールアウトのバックボーンを生成します。次に、専用の17B long-video refinerが、テクスチャを鮮明にし、動きの流動性を向上させさせ、ビデオの後半部分の品質を維持することで、長尺生成に共通する「フェードアウト」効果を防ぎます。
4. 堅牢なアノテーション・パイプライン
高品質なデータは、ワールドモデルの燃料です。研究者たちは、公開ビデオから正確なメトリックスケールの6-DoFカメラポーズを抽出するパイプラインを開発しました。この高品質な教師あり学習を用いることで、約213Kの公開ビデオクリップのみを使用して、64基のH100 GPUでわずか15日間でモデルをトレーニングしました。
パフォーマンスと展開
SANA-WMは、計算資源の節約を目的として設計されています。トレーニングには64基のH100が必要ですが、推論要件は驚くほど低くなっています。
- Standard Deployment: 単一のH100で、1分間の720pビデオを生成できます。
- Consumer Hardware: NVFP4量子化を使用した蒸留版は、単一のRTX 5090で、わずか34秒で60秒間の720pクリップをデノイズできます。
LingBot-WorldやHY-WorldPlayのような産業用ベースラインと比較して、SANA-WMは同等の視覚的品質を実現しながら、36倍高いスループットを達成しています。
批判的な視点:意図性 vs. 生成
技術的なベンチマークは素晴らしいものですが、ワールドモデルの出現は、「作成された」世界の性質に関する哲学的な議論を巻き起こしています。Hacker Newsでは、一部の観察者は、これらのモデルが、ハイエンドのビデオゲームに見られるような、人間が設計した環境に見られる「意図性」を捉えることができるのかどうか疑問を呈しています。
"FromSoftwareのゲームのように、通常、アイテムが一つも置かれた場所に間違いがないゲームがあります... ワールドモデルが、このような種類の意図性を捉えられる場所に到達できるとは、私には想像しがたいです。"
この批判は、根本的なギャップを浮出しさせています。SANA-WMは、世界の見た目をシミュレートすることには長けていますが、まだすべてのオブジェクトの配置の背後にある論理や目的を理解してはいません。しかし、ロボティクスにおける即時的な有用性——システムが現実世界で実行する前に、アクションの含意を作用として「想像」できること——は、強力な有用性として残ります。
結論
SANA-WMは、オープンソースAIにおける極めて重要な瞬間を記しています。分単位の、高解像度ビデオ生成が、比較的少ないパラメータ数(2.6B)と効率的なアテンションメカニズムによって達成可能であることを証明することで、NVIDIAは、研究者がワールドモデルを実験するための障壁を低くしました。コミュニティがこの基盤の上に構築を始めると、コミュニットーとの間で、クローズドソースの産業用巨人と産業用ベースラインとの間で、オープンソースのイノベーションは急速に縮小していくでしょう。