liangnjupt/VisTouch
A large-scale synchronized vision–touch–audio dataset of robotic sliding contact
何を解決するか
VisTouchは、ロボットのスライド接触から得られた大規模で同期されたデータセットを提供し、AIモデルが素材を認識し、視覚、音声、触覚の関係を理解するのを支援します。ロボットインタラクションにおいて、これらの3つのモダリティを厳密に同期した公開データセットの不足を補います。
仕組み
ロボットアームと機敏なハンドを使用して、ハンドが8種類の異なる素材(ブロンズ、シルク、木など)の上を滑らせる際、同時に映像、音声、力・タクチルの軌道を記録します。データは共有ウォールクロックを使用して厳密に同期され、映像の各フレーム、音声サンプル、タクチル読み取りが同じイベントに正確に対応しています。
対象ユーザー
マルチモーダル学習、ロボットビジョン、触覚フィードバックシステムの研究開発に従事する研究者や開発者で、モデルの学習に高品質なペアデータが必要な方々。
特徴
- 厳密な同期: 視覚、音声、力・タクチル信号のイベントレベルでの同期を提供する最初の公開データセット。
- 多様な素材: 8種類の異なる素材をカバーする10,498個の同期クリップを含む。
- マルチモーダルベンチマーク: 素材認識、タクチルスーパーレゾリューション、クロスモーダル生成(例:音声からタクチル力の生成)のためのベースラインモデルを含む。
- 包括的なハードウェア: 2Kカメラ、プロフェッショナルマイクロフォン、機敏なハンドの統合圧力/力センサーを使用してデータを収集。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト