Robostral Navigate 릴리스 노트
Mistral AI는 단일 RGB 카메라와 일상 언어 지침만을 사용하여 로봇이 복잡한 환경을 이동할 수 있도록 설계된 8B 모델인 Robostral Navigate를 발표했습니다. 이 모델은 LiDAR 또는 깊이 센서를 사용하는 방식을 포함하여 기존의 멀티 센서 접근 방식을 능가하면서도 더 효율적입니다.
성능 벤치마크
Robostral Navigate는 훈련 중에 보지 못한 환경에서 지침을 따르는 능력을 측정하는 Room-to-Room in Continuous Environments (R2R-CE) 벤치마크에서 최첨단 성능을 달성했습니다.
- Validation Unseen: 76.6% 성공률.
- Validation Seen: 79.4% 성공률.
이 결과는 최고의 단일 카메라 접근 방식보다 9.7포인트 앞서고, 깊이 센서나 다중 카메라를 활용하는 최고의 시스템보다 4.5포인트 앞서는 것을 나타냅니다.
내비게이션 방법론: Pointing and Displacements
Robostral Navigate는 다음 움직임을 예측하기 위해 "pointing" 메커니즘을 사용합니다. 모델은 현재 카메라 뷰 내에서 대상 위치의 이미지 좌표를 추론하고 도착 시 원하는 방향을 결정합니다. 이 접근 방식은 세계 규모와 카메라 intrinsics의 변화에 정책을 견고하게 만듭니다.
대상 위치가 현재 시야(field of view) 밖에 있는 경우, 모델은 로컬 좌표계 변위(local coordinate frame displacements)로 전환하여 특정 미터 수만큼 앞으로 또는 왼쪽으로 이동하거나 특정 각도로 회전하는 것과 같은 구체적인 지침을 제공합니다.
모델 아키텍처 및 훈련
Robostral Navigate는 객체 위치 지정, 카운팅 및 pointing과 같은 grounding tasks와 같은 작업에 특화된 시각-언어 모델(vision-language model)에서 초기화되어 완전히 자체적으로 구축되었습니다.
데이터 생성
모델은 350,000개의 장면(scenes)에 걸쳐 약 240만 개의 궤적(trajectories)을 생성하는 맞춤형 데이터 생성 파이프라인을 사용하여 시뮬레이션에서 완전히 훈련되었습니다.
지도 학습 훈련 효율성
훈련을 최적화하기 위해 Mistral AI는 트리 기반 어텐션 마스킹(tree-based attention-masking) 전략을 사용하는 prefix-caching 알고리즘을 구현했습니다. 이 방법은 전체 에피소드를 단일 시퀀스로 압축하여 모델이 단일 순방향 패스(forward pass)에서 모든 타임스텝(time steps)에 대해 훈련할 수 있도록 합니다. 이를 통해 훈련 토큰 수를 22배 감소시켜 훈련 기간을 몇 달에서 며칠로 단축했습니다.
온라인 강화 학습
지도 학습 훈련 이후, 모델의 성능은 온라인 강화 학습 알고리즘인 CISPO를 사용하여 더욱 향상되었습니다. 이 방식은 모델이 시행착오를 통해 학습하고 실패로부터 회복할 수 있도록 하여 성공률을 3.2% 향상시키고 vanilla behavior cloning과 관련된 분포 변화(distribution shift) 문제를 완화했습니다.
하드웨어 일반화 및 응용 분야
Robostral Navigate는 크기에 관계없이 바퀴형, 다리형, 비행 로봇에서 실행되는 하드웨어 불가지론적(hardware-agnostic) 모델로 설계되었습니다. 이는 단일 RGB 카메라에만 의존하기 때문에 사무실, 주거용 건물, 상업 공간 및 실외 환경을 포함한 다양한 설정에 적용 가능합니다. Mistral AI는 이러한 기능이 제조, 배송, 물류 및 환대 산업에서의 응용 분야에 핵심적이라고 판단합니다.
Sources
- OriginalIntroducing Robostral Navigate
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch