IamCreateAI/NeoVerse
[CVPR 2026 Highlight & Best Paper of VideoWorldModel Workshop] NeoVerse: Enhancing 4D World Model with in-the-wild Monocular Videos
NeoVerseは、単眼ビデオ映像から3Dシーンを再構成し、新しいカメラ軌跡に沿った高品質なビデオ生成を可能にする4Dワールドモデルです。
What it solves
NeoVerseは、標準的な単一カメラ(単眼)ビデオから4Dワールドモデルを作成するという課題に対処します。通常のビデオを使用して3Dシーンとカメラの動きを再構成することを可能にし、全く異なるカメラ軌跡からの新しいビデオの生成(novel-trajectory video generation)および様々な4D再構成タスクをサポートします。
How it works
NeoVerseは、主に2つのコンポーネントをパイプラインとして組み合わせます:
- Reconstructor: Gaussian Splatsを使用してシーンの3D構造を復元し、単眼ビデオからカメラポーズを推定します。WorldMirrorベースのバージョンやDepth Anything 3を含む、複数の再構成器と互換性があります。
- Video Diffusion Model: 4-step distilled LoRAによって加速されたWAN 2.1バックボーンを使用し、再構成された3Dシーンとターゲットのカメラ軌跡を条件として、高品質なビデオフレームを生成します。
ユーザーは、定義済みのモーション(panning, tilting, または orbiting)を使用するか、精密なキーフレーム制御のためにカスタムJSONファイルを使用することで、軌跡を定義できます。また、静止シーン(単一画像)や、動く物体を含む一般的なシーンも扱うことができます。
Who it’s for
このツールは、単一のビデオからシーンの新しい視点(novel views)を合成したり、手ブレを補正したり、単一視点のビデオをマルチビューシーケンスに拡張したりする必要がある、コンピュータビジョンおよびビデオ生成の研究者や開発者向けに設計されています。
Highlights
- Novel Trajectory Generation: 既存のシーンに対して新しいカメラパス(例:orbit, push-in, boom-up)を作成します。
- Fast Inference: distilled LoRAを使用することで、単一のA800 GPUでパイプラインを30秒以内に完了します。
- Plug-and-Play Reconstructors: シーンの幾何学構造を推定するために、様々な3D再構成器をサポートします。
- Flexible Control: シンプルな定義済みカメラモーションと、複雑なキーフレームレベルのJSON軌跡制御の両方を提供します。
- Downstream Applications: カメラの安定化、ビデオ編集、および単一からマルチビューへの拡張ツールを含みます。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト