openaiotlab/CUHK-X

[MobiSys 2026] A large-scale, multimodal dataset and benchmark for Human Action Recognition, Understanding and Reasoning

何を解決するか

CUHK-Xは、人間の行動認識(HAR)および推論のための包括的で同期されたマルチモーダルデータセットの不足に対処します。大規模なリソースを提供し、単純な行動分類から複雑な人間行動理解(HAU)および次の行動推論(HARn)へと進化させることが可能になります。これは、医療モニタリングやスマート環境において不可欠です。

仕組み

本プロジェクトは、7つの同期モダリティ(RGB動画、赤外線(IR)、熱画像、深度、mmWaveレーダー、スケルトンデータ、IMUセンサー)にわたる64,267サンプルのデータセットを提供します。データは「小規模モデル用データ」と「大規模モデル用データ」の2種類に分類されています。小規模モデルのベースライン用のPyTorchパイプラインと、QwenVLやVideo-LLaVAなどの大規模視覚言語モデル(VLM)を評価するためのベンチマークコードも含まれており、行動キャプション、感情分析、次の行動予測などのタスクに対応しています。

対象ユーザー

マルチモーダル学習、センサ融合、人間行動認識、および物理的・現実世界の行動文脈における大規模言語モデル(LLM)の評価に取り組む研究者や開発者。

特徴

  • 7つの同期モダリティ:視覚(RGB、IR、熱画像、深度)、空間(スケルトン)、非視覚(mmWaveレーダー、IMU)データを統合。
  • 推論ベンチマーク:順序付け、時間的推論、人間の意図に関する因果推論のための特定タスクを含む。
  • LLM駆動のアノテーション:プロンプトベースのフレームワークにより、論理的かつ時空間的なシーン記述を生成。
  • 多様な評価:クロストライアル、クロスサブジェクト(LOSO)、クロスドメインの性能分析をサポート。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト