liangnjupt/VisTouch
A large-scale synchronized vision–touch–audio dataset of robotic sliding contact
해결하는 문제
VisTouch는 로봇 슬라이딩 접촉에서 얻은 대규모 동기화 데이터셋을 제공하여 AI 모델이 재료를 인식하고 시각, 소리, 촉각 간의 관계를 이해할 수 있도록 돕습니다. 로봇 상호작용에서 이 세 가지 모달리티를 엄격하게 동기화한 공개 데이터셋의 부족을 해결합니다.
작동 방식
로봇 팔과 유연한 손을 사용하여 손이 8가지 다른 재료(브론즈, 실크, 나무 등) 위를 미끄러질 때 동시에 영상, 음성, 힘-촉각 궤적을 기록합니다. 데이터는 공유된 월 클록을 사용하여 엄격히 동기화되어 영상의 모든 프레임, 음성 샘플, 촉각 측정값이 동일한 이벤트에 정확히 대응됩니다.
대상 사용자
다중 모달 학습, 로봇 인지, 촉각 피드백 시스템에 종사하는 연구자 및 개발자로, 모델 학습을 위한 고품질의 쌍 데이터가 필요한 분들입니다.
주요 특징
- 엄격한 동기화: 시각, 음성, 힘-촉각 신호의 이벤트 수준에서 동기화를 제공하는 최초의 공개 데이터셋입니다.
- 다양한 재료: 8가지의 서로 다른 재료를 포함한 총 10,498개의 동기화 클립이 있습니다.
- 다중 모달 벤치마크: 재료 인식, 촉각 슈퍼리졸루션, 크로스모달 생성(예: 소리에서 촉각 힘 생성)을 위한 베이스라인 모델이 포함되어 있습니다.
- 포괄적인 하드웨어: 2K 카메라, 프로페셔널 마이크, 유연한 손의 통합 압력/힘 센서를 사용하여 데이터를 캡처했습니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트