Lixsp11/sekai-codebase

[NeurIPS 2025] Sekai: A Video Dataset towards World Exploration

解決的問題

Sekai 解決了沉浸式世界探索與生成所需的、高品質且帶有標註的自我中心影片數據匱乏的問題。它提供大規模的第一人稱與無人機視角影片,幫助 AI 模型更好地理解現實世界的連續性、導航以及視覺與音訊之間的關係。

工作原理

Sekai 是一個由兩個主要部分組成的綜合數據集:Sekai-Real(源自 YouTube)與 Sekai-Game(源自電子遊戲)。該數據集包含來自 100 多個國家與 750 多個城市的超過 5,000 小時的 720p 影片。每段影片都配有詳細的標註,包括位置、場景、天氣、人群密度、字幕以及歸一化相機軌跡(內參與外參矩陣)。

適用對象

本專案專為從事影片理解、自主導航與視聽協同生成的研發人員與開發者設計。

亮點

  • 大規模: 超過 5,000 小時的高解析度影片。
  • 全球覆蓋: 橫跨 100 多個國家與 750 多個城市。
  • 多樣化視角: 包括第一人稱步行視角與無人機視角。
  • 豐富的標註: 提供精確的相機軌跡與環境元數據(天氣、場景等)。
  • 長序列: 專注於 60 秒或更長的序列,以保持現實世界的連續性。

相關

  • 專案
  • Dispatch
  • Dispatch
  • Dispatch
  • 專案