Lixsp11/sekai-codebase

[NeurIPS 2025] Sekai: A Video Dataset towards World Exploration

解決する課題

Sekaiは、没入感のある世界探索と生成に必要な、高品質で注釈付きのエゴセントリック・ビデオデータの不足を解決します。大規模な一人称視点およびドローン視点の映像を提供することで、AIモデルが現実世界の連続性、ナビゲーション、および視覚と音声の関係をより良く理解できるようにします。

仕組み

Sekaiは、主に2つのコンポーネントで構成される包括的なデータセットです:Sekai-Real(YouTubeから取得)とSekai-Game(ビデオゲームから取得)です。このデータセットには、100カ国以上、750都市以上にわたる5,000時間以上の720pビデオが含まれています。各ビデオには、場所、シーン、天候、混雑度、キャプション、および正規化されたカメラ軌道(内部パラメータおよび外部パラメータ行列)を含む詳細な注釈が付けられています。

対象者

このプロジェクトは、ビデオ理解、自律走行ナビゲーション、およびビデオ・オーディオの共同生成に取り組む研究者や開発者向けに設計されています。

ハイライト

  • 大規模: 5,000時間以上の高解像度ビデオ。
  • グローバルなカバー範囲: 100カ国以上、750都市にまたがる。
  • 多様な視点: 一人称視点の歩行とドローン視点の両方を含む。
  • 豊富な注釈: 正確なカメラ軌道と環境メタデータ(天候、シーンなど)を提供。
  • 長尺シーケンス: 現実世界の連続性を維持するため、60秒以上のシーケンスに焦点を当てている。

関連

  • プロジェクト
  • Dispatch
  • Dispatch
  • Dispatch
  • プロジェクト