Lixsp11/sekai-codebase
[NeurIPS 2025] Sekai: A Video Dataset towards World Exploration
解決的問題
Sekai 解決了沉浸式世界探索與生成所需的、高品質且帶有標註的自我中心影片數據匱乏的問題。它提供大規模的第一人稱與無人機視角影片,幫助 AI 模型更好地理解現實世界的連續性、導航以及視覺與音訊之間的關係。
工作原理
Sekai 是一個由兩個主要部分組成的綜合數據集:Sekai-Real(源自 YouTube)與 Sekai-Game(源自電子遊戲)。該數據集包含來自 100 多個國家與 750 多個城市的超過 5,000 小時的 720p 影片。每段影片都配有詳細的標註,包括位置、場景、天氣、人群密度、字幕以及歸一化相機軌跡(內參與外參矩陣)。
適用對象
本專案專為從事影片理解、自主導航與視聽協同生成的研發人員與開發者設計。
亮點
- 大規模: 超過 5,000 小時的高解析度影片。
- 全球覆蓋: 橫跨 100 多個國家與 750 多個城市。
- 多樣化視角: 包括第一人稱步行視角與無人機視角。
- 豐富的標註: 提供精確的相機軌跡與環境元數據(天氣、場景等)。
- 長序列: 專注於 60 秒或更長的序列,以保持現實世界的連續性。
相關
- 專案
- Dispatch
- Dispatch
- Dispatch
- 專案