InternRobotics/VLAC
VLAC: A Vision-Language-Action-Critic Model for Robotic Real-World Reinforcement Learning
해결하는 문제
VLAC은 실제 로봇 강화 학습 및 데이터 정제를 개선하기 위해 설계되었습니다. 로봇 조작 작업에서 조밀하고 정확한 보상 피드백을 제공하고 저품질 궤적을 필터링하는 과제를 해결하며, 이는 전통적인 방법으로 달성하기 어려운 경우가 많습니다.
작동 방식
VLAC은 대규모 인간 에고센트릭 데이터, 공개 로봇 조작 데이터 및 자체 수집 데이터로 훈련된 비전-언어-액션-크리틱 모델입니다. 쌍별 비교 메커니즘을 사용하여 작업 진행 상황을 평가하고 프레임 간의 상태 변화를 인식합니다. 이미지 입력과 작업 설명을 결합하여 모델은 작업 진행 상황을 예측하고, 작업 완료를 확인하며, 성공적인 행동과 실패한 행동을 구분할 수 있습니다.
대상 독자
이 프로젝트는 물리 지능 연구에 종사하는 로봇 공학 연구원 및 개발자, 특히 강화 학습, 모방 학습, 그리고 로봇 훈련을 위한 고품질 궤적 데이터의 필요성에 중점을 두는 사람들을 위한 것입니다.
주요 특징
- 쌍별 비교: 조밀한 크리틱 보상 및 상태 변화 인식의 정확도를 향상시킵니다.
- 멀티모달 기능: 프로세스 추적, 작업 완료 판단, VQA 및 물리적 행동 출력을 지원합니다.
- 제로샷/원샷 일반화: 추가 훈련 없이도 새로운 개체, 시나리오 및 작업에서 성능을 유지합니다.
- 궤적 품질 선별: 저점수 궤적을 필터링하고 부정적인 행동을 마스킹하여 모방 학습 효율성을 향상시킵니다.
- 인간-작업 공감각: 인간 에고센트릭 데이터 (Ego4D)를 활용하여 실제 인간 작업을 더 잘 이해합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트