openaiotlab/CUHK-X
[MobiSys 2026] A large-scale, multimodal dataset and benchmark for Human Action Recognition, Understanding and Reasoning
何を解決するか
CUHK-Xは、人間の行動認識(HAR)および推論のための包括的で同期されたマルチモーダルデータセットの不足に対処します。大規模なリソースを提供し、単純な行動分類から複雑な人間行動理解(HAU)および次の行動推論(HARn)へと進化させることが可能になります。これは、医療モニタリングやスマート環境において不可欠です。
仕組み
本プロジェクトは、7つの同期モダリティ(RGB動画、赤外線(IR)、熱画像、深度、mmWaveレーダー、スケルトンデータ、IMUセンサー)にわたる64,267サンプルのデータセットを提供します。データは「小規模モデル用データ」と「大規模モデル用データ」の2種類に分類されています。小規模モデルのベースライン用のPyTorchパイプラインと、QwenVLやVideo-LLaVAなどの大規模視覚言語モデル(VLM)を評価するためのベンチマークコードも含まれており、行動キャプション、感情分析、次の行動予測などのタスクに対応しています。
対象ユーザー
マルチモーダル学習、センサ融合、人間行動認識、および物理的・現実世界の行動文脈における大規模言語モデル(LLM)の評価に取り組む研究者や開発者。
特徴
- 7つの同期モダリティ:視覚(RGB、IR、熱画像、深度)、空間(スケルトン)、非視覚(mmWaveレーダー、IMU)データを統合。
- 推論ベンチマーク:順序付け、時間的推論、人間の意図に関する因果推論のための特定タスクを含む。
- LLM駆動のアノテーション:プロンプトベースのフレームワークにより、論理的かつ時空間的なシーン記述を生成。
- 多様な評価:クロストライアル、クロスサブジェクト(LOSO)、クロスドメインの性能分析をサポート。
関連
- プロジェクト
vual/lobe-chat-proLobe Chat Pro is an open‑source, self‑hosted AI chat platform (fork of lobe‑chat) that adds a full admin console, user/group management, multi‑vendor model pricing, payment integration (WeChat, Stripe, etc.), and multimodal “infinite canvas” panels for image, music, and video generation. Deployable via Docker in three flavors: full back‑office, gateway‑only with login, or gateway‑only without login.
- プロジェクト
cyx2333hhh/talk-typeリアルタイム音声認識、ローカルWhisperフォールバック、AI駆動のテキスト修正を統合したmacOS用音声入力ツール。アプリケーション間でスムーズな二か国語入力を実現。
- プロジェクト
pwilkin/trellis.cppA standalone C++ implementation of the TRELLIS image-to-3D pipeline using GGML, enabling the generation of textured 3D models from images without Python at runtime.
- プロジェクト
hassancs91/claude-youtube-editorAn open-source pipeline that automates YouTube video editing by turning raw talking-head recordings into polished videos with AI-generated visuals, audio cleaning, and automated uploads.