InternRobotics/InternVLA-A-series

InternVLA-A1: Unifying Understanding, Generation, and Action for Robotic Manipulation​

해결하는 문제

InternVLA-A1.5는 시각-언어 이해, 시각적 예측(미래 역학 예측) 및 동작 생성이라는 세 가지 핵심 능력을 단일 정책으로 통합함으로써 로봇 조작의 구성적 일반화 문제를 해결합니다.

작동 원리

이 시스템은 Qwen3.5-2B VLM을 백본으로 사용하며, 공유 풀 어텐션(full-attention) 레이어를 통해 경량화된 통합 동작 전문가를 추가합니다. 학습 과정에서는 학습 가능한 예측 토큰을 사용하여 멀티모달 컨텍스트에서 미래의 역학을 쿼리하며, 고정된 WAN2.2-5B 비디오 생성 모델의 감독을 받습니다. 실제 배포 시에는 낮은 지연 시간을 유지하기 위해 비디오 브랜치를 제거하며, 모델은 flow matching을 사용하여 연속적인 동작 청크를 예측합니다.

대상

로봇 조작을 연구하는 로봇 연구자 및 개발자, 특히 다양한 시뮬레이션 벤치마크(RoboTwin, LIBERO, SimplerEnv 등) 및 실제 환경에서 로봇이 작업을 일반화하는 방식을 개선하고자 하는 분들을 위해 설계되었습니다.

주요 특징

  • 통합 아키텍처: 이해, 예측 및 동작을 하나의 모델에 결합.
  • 잠재적 예측: 학습 중에 비디오 생성 모델을 사용하여 정책에 미래 작업 역학을 교육.
  • 효율적인 추론: 실행 시 무거운 비디오 브랜치를 제거하여 실용적인 배포 지연 시간 보장.
  • 폭넓은 호환성: LeRobot V2.1 데이터셋 및 다양한 시뮬레이션 환경에서의 미세 조정 지원.

관련

  • Dispatch
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트