liangnjupt/VisTouch

A large-scale synchronized vision–touch–audio dataset of robotic sliding contact

何を解決するか

VisTouchは、ロボットのスライド接触から得られた大規模で同期されたデータセットを提供し、AIモデルが素材を認識し、視覚、音声、触覚の関係を理解するのを支援します。ロボットインタラクションにおいて、これらの3つのモダリティを厳密に同期した公開データセットの不足を補います。

仕組み

ロボットアームと機敏なハンドを使用して、ハンドが8種類の異なる素材(ブロンズ、シルク、木など)の上を滑らせる際、同時に映像、音声、力・タクチルの軌道を記録します。データは共有ウォールクロックを使用して厳密に同期され、映像の各フレーム、音声サンプル、タクチル読み取りが同じイベントに正確に対応しています。

対象ユーザー

マルチモーダル学習、ロボットビジョン、触覚フィードバックシステムの研究開発に従事する研究者や開発者で、モデルの学習に高品質なペアデータが必要な方々。

特徴

  • 厳密な同期: 視覚、音声、力・タクチル信号のイベントレベルでの同期を提供する最初の公開データセット。
  • 多様な素材: 8種類の異なる素材をカバーする10,498個の同期クリップを含む。
  • マルチモーダルベンチマーク: 素材認識、タクチルスーパーレゾリューション、クロスモーダル生成(例:音声からタクチル力の生成)のためのベースラインモデルを含む。
  • 包括的なハードウェア: 2Kカメラ、プロフェッショナルマイクロフォン、機敏なハンドの統合圧力/力センサーを使用してデータを収集。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト