robbyant-research/Zero-WAM
In‑Context World‑Action Modeling from Human Videos for Open‑Ended Task Generalization
해결하는 문제
Zero-WAM은 제로샷 크로스태스크 로봇 조작의 과제를 해결합니다. 로봇이 학습된 적 없는 작업을 수행할 수 있도록 하며, 새로운 로봇 전용 학습 데이터나 파라미터 업데이트 없이도, 배포 시점의 컨텍스트(예: 인간의 시연 영상 또는 언어 지시)를 사용합니다.
작동 방식
이 프로젝트는 인간의 시연 영상을 시각적 작업 사양으로 간주합니다. 제공된 컨텍스트를 기반으로 미래의 로봇 관측값과 실행 가능한 동작을 예측하는 인과적 비디오-액션 정책을 사용합니다. 이를 학습하기 위해 연구진은 "HumanGen" 파이프라인을 개발했습니다. 이 파이프라인은 VLM, 이미지 편집 도구, 비디오 생성 모델을 사용하여 기존 로봇 궤적을 의미적으로 일치하는 인간의 조작 영상으로 변환하여, 대규모의 인간-로봇 인컨텍스트 학습(ICL) 쌍 데이터셋을 구축했습니다.
대상 사용자
이 기술은 오픈엔드 태스크 일반화와 몸체화된 AI에 종사하는 로봇 연구자 및 엔지니어를 위한 것으로, 새로운 조작 태스크마다 막대한 로봇 수집 데이터에 의존하는 것을 줄이고자 하는 사람들에게 적합합니다.
주요 특징
- 인컨텍스트 월드-액션 모델링: 언어와 인간 영상 모두를 작업 지시로 지원하는 단일 정책.
- HumanGen 파이프라인: 8.6K 개의 태스크에 걸쳐 74.2K개의 인간-로봇 ICL 쌍을 생성하는 확장 가능한 시스템.
- 미래 청크 예측: 단기적 학습 경로를 줄이고 모델이 인간 영상 프롬프트에 더 의존하도록 유도하는 목적 함수.
- 제로샷 성능: 모델 파라미터 업데이트 없이 RoboTwin 2.0 및 실제 세계의 미확인 구성에서 성공을 입증.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트