google-research/language-table
Suite of human-collected datasets and a multi-task continuous control benchmark for open vocabulary visuolinguomotor learning.
해결하는 문제
실시간으로 매우 다양한 자연어 지시를 이해하고 실행할 수 있는 로봇을 만드는 문제를 해결합니다. 구체적으로는 "오픈 보캐블러리(open vocabulary)" 시각-언어-운동 학습을 가능하게 하여, 로봇이 인간의 음성에 따라 복잡하고 장기적인 재배치 작업(예: 블록으로 웃는 얼굴 만들기)을 수행할 수 있도록 하는 것을 목표로 합니다.
작동 원리
이 프로젝트는 언어 주석이 달린 대규모 궤적 데이터셋과 멀티태스크 연속 제어 벤치마크를 결합한 프레임워크를 제공합니다. 실제 로봇과 시뮬레이션 모두에서 얻은 수십만 개의 에피소드를 포함하는 이 데이터셋을 사용하여 행동 복제(behavioral cloning) 방식으로 정책을 훈련하며, 이를 통해 시각적 입력과 언어 명령을 운동 기술에 직접 매핑합니다.
대상
로봇 공학, Embodied AI, 그리고 컴퓨터 비전과 자연어 처리의 교차 영역에서 연구하는 연구자와 개발자를 위해 설계되었습니다.
주요 특징
- 대규모 데이터셋: 실제 환경 및 시뮬레이션 환경에 걸쳐 거의 600,000개의 언어 레이블이 지정된 궤적이 포함되어 있습니다.
- 높은 명령 다양성: 이전 연구보다 한 자릿수 더 많은 명령을 지원하며, 87,000개의 고유한 자연어 문자열에 대해 93.5%의 성공률을 기록했습니다.
- 실시간 상호작용: 인간이 실시간 언어를 통해 로봇을 유도하여 정밀한 목표를 달성할 수 있게 합니다.
- 포괄적인 자산: 데이터셋, 훈련 스크립트, 환경 및 사전 학습된 체크포인트를 제공합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- Dispatch