liangnjupt/VisTouch
A large-scale synchronized vision–touch–audio dataset of robotic sliding contact
解決的問題
VisTouch 提供一個大規模、同步的機器人滑動接觸資料集,協助 AI 模型學習辨識材質,並理解視覺、聲音與觸覺之間的關係。它解決了機器人互動中缺乏嚴格對齊這三種模態的公開資料集的問題。
工作原理
使用機器人臂與靈巧手,系統在手滑過八種不同材質(如青銅、絲綢和木頭)時,同步記錄影像、音訊與力-觸覺軌跡。資料透過共用的牆鐘嚴格同步,確保每一幀影像、每一個音訊樣本與每一次觸覺讀數都與同一事件對齊。
適用對象
需要高品質配對資料來訓練模型的多模態學習、機器人感知與觸覺回饋系統的研究人員與開發者。
主要亮點
- 嚴格同步:首個提供視覺、聲音與力-觸覺訊號在事件層級同步的公開資料集。
- 多樣材質:包含 10,498 個同步片段,涵蓋八種不同材質。
- 多模態基準:包含材質辨識、觸覺超解析度與跨模態生成(例如,從聲音生成觸覺力)的基線模型。
- 完整硬體:使用 2K 相機、專業麥克風以及靈巧手內建的壓力/力感測器進行資料擷取。
相關
- 專案
- 專案
- 專案
- 專案
- 專案