openaiotlab/CUHK-X

[MobiSys 2026] A large-scale, multimodal dataset and benchmark for Human Action Recognition, Understanding and Reasoning

해결하는 문제

CUHK-X는 인간 행동 인식(HAR) 및 추론을 위한 포괄적이고 동기화된 다중 모달 데이터셋의 부족을 해결합니다. 단순한 행동 분류를 넘어서 복잡한 인간 행동 이해(HAU)와 다음 행동 추론(HARn)으로 나아갈 수 있는 대규모 자원을 제공하며, 이는 헬스케어 모니터링과 스마트 환경에 필수적입니다.

작동 방식

이 프로젝트는 RGB 비디오, 적외선(IR), 열화상, 깊이, mmWave 레이더, 스켈레톤 데이터, IMU 센서 등 7개의 동기화된 모달리티에 걸쳐 64,267개의 샘플을 포함하는 데이터셋을 제공합니다. 데이터는 '소형 모델 데이터'와 '대형 모델 데이터'로 분류되며, 소형 모델 기준선을 위한 PyTorch 파이프라인과 QwenVL, Video-LLaVA와 같은 대규모 시각-언어 모델(VLM)을 평가하기 위한 벤치마크 코드도 포함되어 있습니다. 행동 캡션, 감정 분석, 다음 행동 예측 등의 작업에 활용됩니다.

대상 사용자

다중 모달 학습, 센서 융합, 인간 행동 인식, 그리고 실제 물리적 환경에서의 대규모 언어 모델(LLM) 평가에 종사하는 연구자 및 개발자.

주요 특징

  • 7개의 동기화된 모달리티: 시각(RGB, IR, 열화상, 깊이), 공간(스켈레톤), 비시각(mmWave 레이더, IMU) 데이터를 통합.
  • 추론 벤치마크: 순차적 재정렬, 시간적 추론, 인간의 의도에 대한 인과 추론을 위한 특정 작업 포함.
  • LLM 기반 어노테이션: 프롬프트 기반 프레임워크를 사용해 논리적이고 시공간적인 장면 설명을 생성.
  • 다양한 평가: 크로스트라이얼, 크로스사용자(LOSO), 크로스도메인 성능 분석을 지원.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트