Gemini Robotics 2: 전신 지능 및 정교함의 발전
Gemini Robotics 2는 전신 협응 및 다중 로봇 팀워크를 가능하게 합니다
Google DeepMind는 로봇 공학을 사전 프로그래밍된 반복적인 작업에서 범용 물리 AI로 이동시키기 위해 설계된 지능 계층인 Gemini Robotics 2를 출시했습니다. 이 시스템은 로봇이 복잡한 움직임을 추론하고, 발부터 손가락 끝까지 전신을 협응하며, 다른 로봇과 협력하여 다단계 워크플로우를 완료할 수 있도록 합니다.
3개 모델 아키텍처
Gemini Robotics 2는 고수준 추론과 저수준 모터 제어 간의 작업을 분담하는 세 가지 전문화된 모델로 구성됩니다:
- Gemini Robotics 2 (VLA): 시각 및 언어 입력을 모터 제어로 직접 변환하는 Vision-Language-Action 모델입니다. 이는 완전한 휴머노이드 움직임과 5손가락 손 및 평행 그리퍼 모두에 대한 고정밀 조작을 관리합니다.
- Gemini Robotics ER 2 (ER): 에이전트의 "brain" 역할을 하는 Embodied Reasoning 모델 (VLM)입니다. 인간과의 통신, 환경 이해, 수 분 동안 지속되는 다단계 작업 계획을 처리합니다. 이 모델은 또한 다중 로봇 협업을 조정합니다.
- Gemini Robotics On-Device 2 (VLA): 네트워크 지연 시간을 제거하기 위해 로컬 실행에 최적화된 효율적인 VLA 모델입니다. 200개 미만의 사례를 사용하여 몇 시간 내에 새로운 로봇 형태(다른 모양, 센서 및 자유도)에 적응할 수 있는 "motion transfer" 기능을 특징으로 합니다.
전신 제어 및 고급 정교함
Gemini Robotics 2는 물리 AI를 단순한 테이블 위 작업에서 전신 협응으로 확장합니다. 의도를 전신 제어로 변환함으로써, 시스템은 특정 위치로 걷기, 몸을 굽히기, 그리고 물체를 하단 선반에 정확하게 배치하는 것과 같은 복잡한 시퀀스를 관리할 수 있습니다.
고정밀 조작
이 시스템은 다양한 하드웨어 엔드 이펙터(end-effectors)에서 상당한 정교함의 도약을 보여줍니다:
- 5손가락 손: Apollo 2 휴머노이드의 22 자유도 SharpaWave 손을 사용하여, 모델은 매듭을 묶거나 지퍼백을 밀봉하는 것과 같은 섬세한 작업을 수행할 수 있습니다.
- 평행 그리퍼: Franka Duo 플랫폼에서, 모델은 표준 2손가락 그리퍼를 사용하여 복잡한 패킹 작업을 수행합니다.
에이전트 추론 및 안전 오케스트레이션
수 분 동안 지속되고 수백 개의 결정이 포함된 작업을 관리하기 위해, Gemini Robotics ER 2는 고수준 오케스트레이션을 제공합니다. 환경을 관찰하고, 필요한 단계를 추론하며, 특정 작업이 실패할 경우 스스로 수정합니다.
안전 및 ASIMOV-Agentic 벤치마크
Google은 에이전트 안전 오케스트레이션을 위한 새로운 벤치마크인 ASIMOV-Agentic을 도입했습니다. 이 프레임워크는 로봇의 다음 능력을 측정합니다:
- VLA가 요청한 안전하지 않은 도구 호출을 거부함.
- 작업이 물리적으로 가능한지 예측함.
- 불확실성이 높을 때 선제적으로 인간의 개입을 요청함.
또한, Gemini Robotics ER 2는 인간의 근접성을 감지하고 협업 안전 표준을 준수하기 위해 안전 정지를 트리거합니다.
기술적 관점 및 커뮤니티 논의
발표 내용이 상당한 진정을 보여주지만, 기술 커뮤니티는 LLM 기반 로봇 공학의 실제 배포에 대해 몇 가지 중요한 사항을들을 제기했습니다:
지연 시간 및 제어
일부 개발자들은 전체 LLM을 구동(actuation)에 사용하는 것이 수용할 수 없는 지연 시간(약 1-2초로 추정)을 초래할 수 있다고 주장합니다. 이는 실시간 로봇 공학에 비실현적입니다. 일반적인 대안은 시각에는 ML을 사용하되, 동작 구동을 위한 전통적인 PID 방식의 선형/비선형 제어를 유지하는 것입니다.
하드웨어 및 안전 문제
사용자들 사이의 논의는 가정 환경에서의 강력한 휴머노이드 로봇의 "소송 위험"을 언급하며, noteing하여, 무거운 노동을 수행할 수 있을 만큼 강력한 로봇은 오작동 시 심각한 부상을 입힐 수 있을 만큼 강력하다는 점을 지기했습니다.
성능 지표
동반된 기술 데이터를 통해 성공률이 약 60% 및 정확도 80%를 시정하여, 비판론자들은 이러한 수치가 기술이 자율적인 가정용 또는 산업용 사용을 위해 아직 생산 준비가 되지 않았음을 나타낸다고 주장합니다.
"If progress is as fast as LLMs, this could have massive applications in a few years." — @FartyMcFarter
"The big one will be using AI to design and build highly specialized robots to automate mining and manufacturing." — @baron816
Sources
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch