Mistral AI Robostral Navigate 8B 모델, 단일 카메라 구현 내비게이션 가능

TL;DR

Mistral AI는 Robostral Navigate를 출시했으며, 8 B 파라미터 모델로 단일 RGB 카메라로 로봇을 내비게이션하고, 보지 않은 R2R‑CE 벤치마크에서 76.6 % 성공률을 달성했습니다—최고 단일 카메라 시스템보다 9.7 포인트, 최고 다중 센서 시스템보다 4.5 포인트 높습니다. 이 모델은 완전히 시뮬레이션에서 학습되었으며, 새로운 포인팅 기반 정책을 사용하고, 휠, 레그, 비행 플랫폼에서 실행됩니다.


최신 벤치마크 성능

Robostral Navigate는 보는 검증에서 79.4 % 성공률보지 않은 검증에서 76.6 % 성공률을 달성했습니다. 이는 이전 최고 단일 카메라 접근법보다 9.7 포인트 높으며, 가장 강력한 깊이·다중 카메라 시스템보다 4.5 포인트 앞섭니다, 비록 일반 RGB 카메라 하나만 사용했음에도 불구하고.

"Robostral Navigate는 일반 RGB 카메라 하나만 사용하고 깊이 센서는 전혀 없지만, 보지 않은 R2R‑CE 검증에서 여전히 76.6%를 달성합니다" – Mistral AI blog.

이 결과는 대규모 시뮬레이션 데이터와 토큰 효율적인 학습이 많은 실내 내비게이션 작업에서 비싼 센서 스위트를 대체할 수 있음을 보여줍니다.


최소 센서 스택: 카메라 하나, LiDAR 없음

모델의 단일 카메라 설계는 LiDAR, 깊이 카메라, 다중 카메라 장비의 필요성을 없앱니다. 다음 웨이포인트의 이미지 공간 좌표(“pointing” 액션)를 예측함으로써 정책은 카메라 내재 파라미터와 세계 스케일 변화에 강인합니다. 목표가 시야 밖에 있을 경우, 모델은 로컬 변위 명령(예: "move 2 m forward, 1.5 m left")으로 전환합니다.

"Pointing은 정책을 카메라 내재 파라미터와 세계 스케일 변화에 자연스럽게 강인하게 만듭니다" – Mistral AI.

커뮤니티 인사이트

"It's implied, and I'm hoping it's true, that this is a map‑less navigation. Which is impressive. This kind of task is much easier if you have a pre‑captured map of the environment..." – iandanforth (Hacker News)


학습 파이프라인 및 효율성

Robostral Navigate는 전적으로 자체 제작으로 구축되었으며 기존 오픈소스 비전‑언어 모델에 의존하지 않습니다. 이는 Mistral의 grounding(포인팅, 카운팅, 객체 위치 지정)에 특화된 비전‑언어 모델에서 시작해 내비게이션으로 확장됩니다.

  • 데이터 생성: 6 k 시뮬레이션 씬에서 약 400 k 트래젝터리, 모두 맞춤형 시뮬레이션 파이프라인으로 생성.
  • Prefix‑caching: 트리 기반 어텐션 마스크가 전체 에피소드를 하나의 시퀀스로 압축해 모델이 모든 타임스텝을 한 번의 포워드 패스로 처리하면서 누수를 방지합니다. 이는 토큰 수를 22× 줄이고 학습 시간을 몇 달에서 며칠로 단축합니다.
  • Online reinforcement learning (CISPO): 감독 사전학습 후, 온라인 RL 알고리즘으로 미세조정해 성공률에 3.2 포인트를 추가하고 분포 이동을 완화합니다.

다양한 플랫폼에서의 일반화

모델은 바퀴, 다리, 비행 로봇에서 실행되며 로봇 크기와 카메라 내재 파라미터 변동에 강인합니다. 이러한 플랫폼‑불변 능력은 시뮬레이션‑우선 데이터 생성과 추상적인 이미지‑공간 포인팅 표현의 직접적인 결과입니다.


실제 시연

Mistral의 영상은 로봇이 복잡한 사무실에서 장거리 명령을 수행하며, 훈련 중 보지 못한 사람과 장애물을 회피하는 모습을 보여줍니다. 데모는 2× speed로 실행되며, 이는 로봇 연구에서 부드러운 동작을 전달하기 위한 일반적인 관행입니다.

"Robostral Navigate가 작업 중인 사무실을 가로지르는 장거리 명령 경로를 완전 자율적으로 실행" – Mistral AI.

커뮤니티 회의론

"R2R‑CE는 시뮬레이션 환경으로 구성된 벤치마크입니다. 따라서 이 벤치마크를 능가한다는 것은 로봇이 마인크래프트를 하는 것만큼 유용하다는 의미입니다..." – YeGoblynQueenne (Hacker News)


제한 사항 및 열린 질문

  • 맵 없는 내비게이션: 블로그는 모델이 내부 지도를 구축하는지 혹은 순수 반응형 포인팅에만 의존하는지 명시하지 않습니다. 커뮤니티 추측은 맵 없이 동작한다는 것이지만 세부 사항은 부족합니다.
  • 물리적 견고성: 데모 환경은 정돈되어 있으나, 복잡하고 동적인 실제 환경을 다루는 것은 아직 해결되지 않은 과제입니다.
  • 통합 세부 사항: 블로그는 포인팅 출력이 저수준 모터 명령으로 어떻게 변환되는지 설명하지 않습니다. 커뮤니티는 이에 대한 명확한 설명을 요청하고 있습니다.

"블로그가 충분한 세부 정보를 제공하지 않는데, 누군가 포인팅 액션이 로봇의 저수준 움직임 명령으로 어떻게 변환되는지 밝혀줄 수 있다면 좋겠습니다!" – mosfets (Hacker News)


취미 개발자와 연구자를 위한 가능성

모델은 공개되지 않음 상태이며, 여러 댓글러가 취미 프로젝트에 대한 접근성을 궁금해합니다.

"이 모델은 공개적으로 이용 가능하지 않은 것처럼 보이지만, 만약 공개된다면 손쉬운 단일 카메라 내비게이션 설정이 많은 멋진 취미 프로젝트를 가능하게 할 것이라고 생각합니다." – humanperhaps

"이 모델을 실제로 사용하려면 어떤 현실적인 경로가 있을까요? OpenClaw에 연결해 취미로 탐험하고 싶습니다..." – HanClinto

Mistral은 상업 파트너십에 관심을 보이며 로봇 인재를 채용하고 있어, 초기 접근은 기업 협력자에게 제한될 수 있음을 시사합니다.


전망

Robostral Navigate는 통합된 구현 AI 에이전트를 향한 첫 걸음을 의미합니다. 최소 센싱으로 복잡한 실내·실외 공간을 내비게이션할 수 있습니다. 대규모 시뮬레이션, 효율적인 학습, grounding‑first 비전‑언어 모델을 결합함으로써 Mistral은 고성능 내비게이션에 무거운 센서 스위트가 필요 없음을 입증했습니다.

  1. 모델을 조작 작업(그립, 객체 상호작용)으로 확장하면 추가적인 인식 모달리티가 필요합니다.
  2. 실제 환경 평가를 다양한 복잡하고 어수선한 환경에서 수행해 시뮬레이션‑투‑실제 전이를 검증합니다.
  3. 오픈소스 또는 라이선스 경로를 마련해 학계와 취미 개발자에게 채택 기회를 제공합니다.

참고 문헌

  • Mistral AI 블로그 포스트: Robostral Navigate: single‑camera AI navigationhttps://mistral.ai/news/robostral-navigate/
  • R2R‑CE 벤치마크 설명 (Room‑to‑Room in Continuous Environments).
  • CISPO 강화학습 알고리즘 (Mistral이 언급한 바와 같이).

이 기사는 공식 발표와 Hacker News 커뮤니티 의견(게시물 ID 48832212)을 종합하여 작성되었습니다.

Sources

관련

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch