IamCreateAI/NeoVerse

[CVPR 2026 Highlight & Best Paper of VideoWorldModel Workshop] NeoVerse: Enhancing 4D World Model with in-the-wild Monocular Videos

What it solves

NeoVerse 解決了從標準、單相機(單目)影片中建立 4D 世界模型的挑戰。它允許用戶使用普通影片,重建 3D 場景與相機運動,從而實現從完全不同的相機軌跡(新穎軌跡影片生成)生成新影片,並支持各種 4D 重建任務。

How it works

NeoVerse 將兩個主要組件整合進一個流水線中:

  1. Reconstructor: 使用 Gaussian Splats 重建場景的 3D 結構,並從單目影片中估計相機位姿。它與多種重建器相容,包括基於 WorldMirror 的版本和 Depth Anything 3。

  2. Video Diffusion Model: 使用由 4-step distilled LoRA 加速的 WAN 2.1 主幹網路,系統根據重建的 3D 場景與目標相機軌跡生成高品質的影片幀。

用戶可以透過預定義的運動(如平移、傾斜或環繞)來定義軌跡,或透過自定義的 JSON 檔案來進行精確的關鍵幀控制。系統也可以處理靜態場景(單張影像)或帶有移動物體的通用場景。

Who it’s for

此工具是為電腦視覺與影片生成領域的研究人員與開發人員設計的,他們需要從單一影片中合成新穎的視角,合成穩定的影像,或將單視角影片擴展為多視角序列。

Highlights

  • Novel Trajectory Generation: 為現有場景建立新的相機路徑(例如:環繞、推入、升起)。
  • Fast Inference: 使用 distilled LoRA,在單張 A800 GPU 上可在 30 秒內完成整個流水線。
  • Plug-and-Play Reconstructors: 支持多種 3D 重建器來估計場景幾何結構。
  • Flexible Control: 提供簡單的預定義相機運動與複雜的、關鍵幀層級的 JSON 軌跡控制。
  • Downstream Applications: 包括相機穩定化、影片編輯與單視角轉多視角擴展工具。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案