Lixsp11/sekai-codebase
[NeurIPS 2025] Sekai: A Video Dataset towards World Exploration
해결하는 문제
Sekai는 몰입형 세계 탐험 및 생성에 필요한 고품질의 주석이 달린 에고센트릭 비디오 데이터의 부족 문제를 해결합니다. 대규모의 1인칭 및 드론 뷰 영상을 제공하여 AI 모델이 현실 세계의 연속성, 내비게이션, 그리고 시각과 오디오 간의 관계를 더 잘 이해하도록 돕습니다.
작동 방식
Sekai는 두 가지 주요 구성 요소인 Sekai-Real(YouTube 소스)과 Sekai-Game(비디오 게임 소스)으로 구성된 포괄적인 데이터셋입니다. 이 데이터셋은 100개 이상의 국가와 750개 이상의 도시에 걸친 5,000시간 이상의 720p 영상을 포함합니다. 각 영상에는 위치, 장면, 날씨, 인파 수준, 캡션 및 정규화된 카메라 궤적(내부 및 외부 행렬)을 포함한 상세한 주석이 포함되어 있습니다.
대상
이 프로젝트는 비디오 이해, 자율 주행 내비게이션 및 비디오-오디오 공동 생성 분야에서 연구하는 연구자와 개발자를 위해 설계되었습니다.
주요 특징
- 대규모 규모: 5,000시간 이상의 고해상도 영상.
- 전 세계적 범위: 100개 이상의 국가와 750개 이상의 도시를 아우름.
- 다양한 관점: 1인칭 보행 및 드론 관점을 모두 포함.
- 풍부한 주석: 정확한 카메라 궤적 및 환경 메타데이터(날씨, 장면 등) 제공.
- 긴 시퀀스: 현실 세계의 연속성을 유지하기 위해 60초 이상의 시퀀스에 집중.
관련
- 프로젝트
- Dispatch
- Dispatch
- Dispatch
- 프로젝트