X-Square-Robot/wall-x

Building General-Purpose Robots Based on Embodied Foundation Model

해결하는 문제

Wall-X는 신체적 기초 모델을 사용하여 일반 목적의 로봇을 구축하기 위한 프레임워크를 제공합니다. 시각-언어 모델(VLM)과 물리적 상호작용 사이의 격차를 메우며, 고정밀 상호작용 데이터를 기반으로 로봇이 물리 세계에서 효과적으로 행동하는 방법을 이해할 수 있도록 합니다.

작동 방식

이 프로젝트는 시각-언어-행동(VLA) 아키텍처를 구현합니다. 대규모 다중 모달 사전 학습을 활용하여 언어와 시각을 특정 로봇 행동과 연결합니다. 시스템은 흐름 매칭과 FAST 행동 브랜치를 포함한 특화된 학습 및 추론 스택을 포함하며, 성능을 위해 CUDA 연산자를 사용합니다. LeRobot 데이터 형식과 통합되어 데이터 준비에 사용되며, FSDP(전체 분산 데이터 병렬) 학습을 통한 미세 조정을 지원합니다.

대상 사용자

이 프레임워크는 신체적 인공지능에 종사하는 로봇 연구자 및 개발자를 대상으로 하며, 특히 실제 로봇 조작 및 시뮬레이터 평가를 위한 시각-언어-행동 모델의 배포 및 미세 조정을 고려하는 사람들을 위한 것입니다.

주요 특징

  • 배포 준비 완료 VLA: 실시간 로봇 조작을 위한 Wall-OSS-0.5 모델 포함.
  • 세계 행동 모델링: 미래 영상 상상과 행동 예측을 결합한 WALL-WM 제공.
  • 통합 생태계: LeRobot 데이터 준비 도구, 실시간 행동 추론을 위한 WebSocket 서빙, LIBERO 시뮬레이터 평가 도구 제공.
  • 성능 최적화: FlashAttention 및 커스텀 CUDA 연산자를 사용하여 효율적인 추론과 학습 보장.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트