Lixsp11/sekai-codebase
[NeurIPS 2025] Sekai: A Video Dataset towards World Exploration
解决的问题
Sekai 解决了沉浸式世界探索与生成所需的、高质量且带有标注的自我中心视频数据的匮乏问题。它提供大规模的第一人称和无人机视角视频,帮助 AI 模型更好地理解现实世界的连续性、导航以及视觉与音频之间的关系。
工作原理
Sekai 是一个由两个主要部分组成的综合数据集:Sekai-Real(源自 YouTube)和 Sekai-Game(源自视频游戏)。该数据集包含来自 100 多个国家和 750 多个城市的超过 5,000 小时的 720p 视频。每段视频都配有详细的标注,包括位置、场景、天气、人群密度、字幕以及归一化相机轨迹(内参和外参矩阵)。
适用对象
本项目专为从事视频理解、自主导航和视听协同生成研究的科研人员和开发人员设计。
亮点
- 大规模: 超过 5,000 小时的高分辨率视频。
- 全球覆盖: 跨越 100 多个国家和 750 多个城市。
- 多样化视角: 包括第一人称步行视角和无人机视角。
- 丰富的标注: 提供精确的相机轨迹和环境元数据(天气、场景等)。
- 长序列: 专注于 60 秒或更长的序列,以保持现实世界的连续性。
相关
- 项目
- Dispatch
- Dispatch
- Dispatch
- 项目