Gemini Robotics ER 2 릴리즈 노트 / 새로운 기능
Google DeepMind는 로봇의 두뇌 역할을 하도록 설계된 고급 “embodied reasoning” 모델인 Gemini Robotics ER 2를 소개했습니다. 이 모델은 로봇이 인간과 상호작용하고, 물리적 환경을 이해하며, 다단계 작업을 계획하도록 하며, 이를 하위 수준의 vision-language-action (VLA) 모델에 전달해 모터 실행을 수행합니다.
실시간 작업 오케스트레이션 및 에이전시 기능
Gemini Robotics ER 2는 복잡하고 다단계 워크플로를 오케스트레이션하는 물리적 에이전트로 작동하여 로봇이 스스로 교정하고 새로운 상황에 일반화할 수 있게 합니다. 개발자는 내비게이션 API나 VLA 모델과 같은 저수준 제어 인터페이스를 모델이 네이티브하게 호출할 수 있는 도구로 통합할 수 있으며, Google Search와 같은 도구와 함께 사용할 수 있습니다.
Key improvements in orchestration include:
- Latency Reduction: Gemini Live API와의 양방향 스트리밍 엔드포인트 통합을 통해 “멈추고 생각하기” 일시 중지를 최소화하여 작업을 원활하게 실행합니다.
- Performance Gains: 이 모델은 실제 VLA, 시뮬레이션 VLA, 인간 원격 조작 모드 전반에 걸쳐 도구 오케스트레이션에서 Gemini Robotics ER 1.6을 지속적으로 능가합니다.
- Practical Application: Boston Dynamics의 Spot을 사용한 시연에서, 모델은 자연어 명령에 따라 물체를 가져오기 위해 Spot API를 활용해 내비게이션 및 매니퓰레이터 움직임을 오케스트레이션했습니다.
시간 지능 및 비디오 이해
Gemini Robotics ER 2는 “시간 지능”에 대한 중요한 발전을 도입하여 로봇이 진행 상황을 추적하고 작업 전환을 위한 정확한 순간을 식별할 수 있게 합니다.
연속 진행 분류
모델은 비디오 피드의 프레임을 5개의 진행 단계(0-20%에서 80-100%)로 할당하여 작업 완료까지의 진행 상황을 추적할 수 있습니다. 이를 통해 로봇은 전체 워크플로를 재시작하지 않고도 실시간으로 동작을 조정하거나 실패한 단계를 재시도할 수 있습니다. Gemini Robotics ER 2는 진행 분류에서 57.4% 정확도를 달성하여 이전 세대 및 경쟁 최첨단 모델을 능가합니다.
정밀 순간 찾기
작업 전환 시점을 정확히 판단하기 위해(예: 액체를 붓는 것을 언제 멈출지) 모델은 순간 찾기를 활용합니다. 91.3% 정확도와 0.96초 평균 절대 거리를 달성했습니다. 이 정밀도는 더 큰 모델 카테고리 대비 4배 빠른 실행 속도로 제공되어 안전한 실제 운영에 필요한 서브초 지연을 제공합니다.
다중 로봇 협업 및 공간 지능
Gemini Robotics ER 2는 다양한 로봇이 공유된 의미 이해를 통해 소통하여 단일 로봇만으로는 수행할 수 없는 작업을 완수하도록 합니다. 이 협업은 Apptronik의 Apollo 2와 Franka F3 Duo를 사용한 시연으로 입증되었습니다.
Additionally, the model improves general spatial intelligence across three core areas:
- Success/Failure Detection: 이제 정적 스냅샷 대신 원시 비디오 피드를 사용하여 미실행 중 미끄러짐이나 유출과 같은 실패를 감지합니다.
- General Instrument Reading: 모델은 이제 디지털 디스플레이, 선형 눈금, 액체 온도계 등을 포함한 10가지 종류의 계기를 읽을 수 있습니다.
- Enhanced Spatial VQA: 고급 멀티모달 이해를 통해 향상된 시각 질문 응답 기능을 제공합니다.
안전 및 인간 근접성
Gemini Robotics ER 2는 현재까지 Google DeepMind가 만든 가장 안전한 embodied reasoning 모델로 설명됩니다. 안전 지시 따르기 및 인간 근접성 벤치마크에서 큰 향상을 보이며, 특히 사람이 근처에 있을 때 인간형 로봇을 정지시키고 구역이 비워지면 다시 시작하는 능력을 입증했습니다.
Google DeepMind는 또한 환경을 모니터링하고 안전 제약을 적용하며 물리적 실행 가능성을 평가함으로써 안전한 VLA 오케스트레이터 역할을 수행할 수 있는 기반 모델의 역량을 평가하는 새로운 벤치마크를 도입했습니다.