Gemini Robotics 1.5 및 Gemini Robotics-ER 1.5 릴리스

Google DeepMind는 AI 에이전트를 디지털 환경에서 물리적 세계로 전환하도록 설계된 두 개의 특수 모델인 Gemini Robotics 1.5와 Gemini Robotics-ER 1.5를 출시했습니다. 고수준 계획과 저수준 모터 실행으로 인지 부하를 분할함으로써, 이 모델들은 로봇이 복잡하고 다단계 작업을 보다 높은 투명성과 일반화 능력으로 인식하고, 계획하고, 행동하도록 합니다.

에이전시 프레임워크: 오케스트레이션 및 실행

Google DeepMind는 지역 재활용 지침에 따라 물체를 분류하는 등 현실 세계 작업의 복잡성을 처리하기 위해 두 모델 에이전시 프레임워크를 활용합니다.

Gemini Robotics-ER 1.5 (구현된 추론)

Gemini Robotics-ER 1.5는 시스템의 "고수준 뇌" 역할을 합니다. 이는 구현된 추론에 최적화된 시각-언어 모델(VLM)로 로봇의 전반적인 활동을 오케스트레이션합니다. 주요 기능은 다음과 같습니다:

  • 계획 및 의사결정: 임무를 완수하기 위한 상세하고 다단계 계획을 생성합니다.
  • 도구 통합: Google Search와 같은 디지털 도구나 서드파티 사용자 정의 함수를 원활하게 호출하여 필요한 정보를 수집합니다.
  • 공간 이해: 포인팅, 이미지 질문 응답, 비디오 질문 응답 등을 포함한 공간 이해 벤치마크에서 최첨단 성능을 달성합니다.
  • 모니터링: 작업 전반에 걸쳐 자신의 성공 및 진행 상황을 추정합니다.

Gemini Robotics 1.5 (시각-언어-액션)

Gemini Robotics 1.5는 ER 모델이 제공한 자연어 지시를 직접적인 모터 명령으로 변환하는 시각-언어-액션(VLA) 모델입니다. 전통적인 VLA 모델이 단순히 계획을 움직임으로 번역하는 것과 달리, Gemini Robotics 1.5는 "행동하기 전에 생각"하여 자연어로 내부 추론 및 분석 순서를 생성합니다. 이를 통해 로봇은 다음을 수행할 수 있습니다:

  • 복잡한 작업 분해: 긴 작업을 더 간단하고 짧은 세그먼트로 나누어 보다 신뢰성 있는 실행을 가능하게 합니다.
  • 투명성 향상: 자연어로 사고 과정을 설명하여 사용자가 의사결정 과정을 볼 수 있게 합니다.
  • 견고성 향상: 새로운 작업에 더 잘 일반화하고 환경 변화에 적응합니다.

교차 구현 학습 및 일반화

Gemini Robotics 1.5는 형태, 크기, 자유도 등이 다른 로봇 간에 기술을 전이하는 문제를 해결합니다. 이 모델은 구현 간 학습 능력을 보여주며, 한 로봇에서 학습된 동작을 다른 로봇으로 전이할 때 각 하드웨어 구성에 대한 모델 특수화 없이도 가능합니다.

Google DeepMind는 여러 플랫폼에서 이 능력을 관찰했습니다: ALOHA 2 로봇에서 학습된 작업이 Apptronik Apollo 휴머노이드 로봇 및 양팔 Franka 로봇에서 성공적으로 실행되었으며, 그 반대도 마찬가지였습니다.

성능 벤치마크 및 안전

공간 추론 벤치마크

Gemini Robotics-ER 1.5는 15개의 학술 벤치마크에서 평가되어 최첨단 종합 성능을 달성했습니다. 포함된 벤치마크는 다음과 같습니다:

  • Embodied Reasoning Question Answering (ERQA)
  • Point-Bench
  • RefSpatial, RoboSpatial-Pointing, Where2Place, BLINK, CV-Bench, EmbSpatial, MindCube, RoboSpatial-VQA, SAT, Cosmos-Reason1, Min Video Pairs, OpenEQA, and VSI-Bench.

의미 안전 및 ASIMOV 벤치마크

인간 중심 환경에서 책임 있는 배포를 보장하기 위해 Google DeepMind는 의미 안전성을 평가하기 위한 데이터셋 모음인 ASIMOV 벤치마크를 업데이트했습니다. Gemini Robotics-ER 1.5는 이 벤치마크에서 최첨단 성능을 보입니다.

안전은 전체론적 접근을 통해 구현됩니다:

  • 고수준 추론: 모델은 행동하기 전에 안전 제약을 고려합니다.
  • 정책 정렬: 대화가 Gemini 안전 정책에 맞게 정렬됩니다.
  • 저수준 트리거: 필요 시 시스템이 충돌 회피와 같은 온보드 안전 하위 시스템을 작동시킬 수 있습니다.

이용 가능 여부

  • Gemini Robotics-ER 1.5: Google AI Studio의 Gemini API를 통해 개발자에게 제공됩니다.
  • Gemini Robotics 1.5: 현재 선택된 파트너에게만 제공됩니다.

SUMMARY: Google DeepMind는 고수준 구현 추론과 직접적인 시각-언어-액션 제어를 결합한 Gemini Robotics 1.5와 Gemini Robotics-ER 1.5 모델을 소개했습니다. 이를 통해 로봇은 복잡하고 다단계의 물리적 작업을 수행할 수 있습니다.

TITLE: Gemini Robotics 1.5 및 Gemini Robotics-ER 1.5 릴리스

Sources