Eyeline-Labs/Vista4D

Official code, models, and data for Vista4D: Video Reshooting with 4D Point Clouds (CVPR 2026 Highlight)

何を解決するか

Vista4Dは、ソース動画から完全に新しいカメラ軌道と視点で動的シーンを合成するという「動画リショット」の課題に対処します。特に、現実世界の動画の不正確な4D再構成を用いて動画生成をガイドする際に発生する分布シフトやアーティファクトの問題を解決します。

動作方法

Vista4Dは4Dポイントクラウドを使用して動的シーンを表現します。ノイズのある再構成マルチビュー動画上で訓練することで、実世界の4D再構成に典型的なアーティファクトに対してモデルの耐性を高め、トレーニングと推論のギャップを埋めます。シーンのコンテンツを保持し、カメラ制御を向上させるために、時間的に持続する静的ポイントを組み込みます。このフレームワークは、Wan 2.1 (T2V-14B) モデルのファインチューニング版として構築されています。

対象ユーザー

このツールは、既存の動画のカメラアングルを変更したい、動的シーンを拡張したい、または4Dシーンの再構成を行いたいコンピュータビジョンおよび動画合成の研究者や開発者向けです。

特徴

  • 耐障害性のある4Dガイド: 実世界の動画からの不正確な4D再構成に対応可能。
  • 柔軟な応用: 動的シーンの拡張、4Dシーンの再構成(ポイントクラウド編集)、メモリを活用した長時間動画推論をサポート。
  • インタラクティブカメラUI: ViserベースのUIを備え、ターゲットカメラパスの設計やポイントクラウドの編集が可能。
  • マルチGPU対応: Unified Sequence Parallel (USP) を実装し、VRAM使用量を削減し、推論を高速化。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト