SIMA 2: 가상 3D 세계에서 함께 플레이하고, 추론하고, 배우는 에이전트
SIMA 2는 명령 따르기에서 상호작용적 추론으로 진화한다
Google DeepMind은 SIMA 2를 소개했는데, 이는 Gemini 모델을 통합하여 기본적인 명령 따르는 에이전트에서 상호작용적인 게임 동반자로 전환하는 범용 AI 에이전트입니다. 그 전작과 달리, SIMA 2는 고수준 목표에 대해 추론하고, 사용자와 대화하여 의도한 행동을 설명하며, 자가 주도 플레이를 통해 시간이 지남에 따라 성능을 향상시킬 수 있습니다.
고급 추론을 위한 Gemini 통합
SIMA 2는 핵심 아키텍처로 Gemini 모델을 활용하여 원래 SIMA의 600개 언어 따르기 기술을 넘어설 수 있게 합니다. 이 통합은 에이전트가 가상 키보드와 마우스를 사용하여 복잡한 3D 환경에서 목표 지향적인 행동을 인지하고, 이해하며, 실행할 수 있게 하며, 기본 게임 메커니즘에 접근하지 않아도 됩니다.
Key technical advancements in reasoning include:
- 목표 지향적 실행: 에이전트는 고수준 사용자 목표를 이해하고 이를 달성하기 위해 필요한 복잡한 추론을 수행할 수 있습니다.
- 투명한 커뮤니케이션: 인간 시연 비디오와 Gemini가 생성한 라벨의 혼합물로 훈련된 SIMA 2는 작업을 수행하기 위해 취하고 있는 구체적인 단계를 상세히 설명할 수 있습니다.
- 협업적 상호작용: 상호작용 모델은 단순한 명령-응답에서 에이전트가 사용자와 함께 작업에 대해 추론하는 협업 파트너십으로 변화했습니다.
미확인 환경에서의 일반화
SIMA 2는 첫 번째 버전보다 일반화와 신뢰성이 크게 향상되었으며, 다양한 작업에서 인간 수준에 가까운 성능을 보여줍니다. 서로 다른 게임 간에 학습된 개념을転移할 수 있습니다—예를 들어, 한 게임의 '채광' 개념을 다른 게임의 '수확'에 적용할 수 있습니다.
The agent's generalization capabilities include:
- 복잡한 작업 처리: 길고 미묘한 명령을 이해하고 수행할 수 있는 능력.
- 멀티모달 이해: 멀티모달 프롬프트, 다양한 언어, 이모티콘을 지원합니다.
- 제로샷 적응성: SIMA 2는 훈련되지 않은 게임에서도 작동할 수 있습니다. 예를 들어, 바이킹 생존 게임 ASKA 및 연구 구현 MineDojo (Minecraft)에서 작동할 수 있습니다.
- 합성 세계 적응: Genie 3—텍스트 또는 이미지로 실시간 3D 시뮬레이션 세계를 생성하는 모델—과 페어링될 때, SIMA 2는 자신이 никогда encounter하지 않은 완전히 새로이 상상된 환경에서 자신을 orient하고 의미 있는 행동을 취할 수 있습니다.
확장 가능한 자기 개선 사이클
SIMA 2는 다중 작업 자기 개선 능력을 도입하여, 추가적인 인간 생성 데이터 없이 새로운 세계에서 기술을 개발할 수 있게 합니다. 이는 반복적 개선의 선순환 사이클을 통해 달성됩니다:
- 초기 가이드라인: Gemini는 에이전트의 행동에 대한 초기 작업과 예상 보상을 제공합니다.
- 경험 뱅킹: 이 정보는 자가 생성 경험의 뱅크에 저장됩니다.
- 반복적 훈련: 에이전트는 이 경험을 사용하여 후속 세대를 훈련시키고, 인간 개입 없이 이전에 실패한 작업을 극복할 수 있게 합니다.
이 과정은 새로 생성된 Genie 환경으로 확장되었으며, 다양한 생성된 세계에서 범용 에이전트를 훈련시키는 중요한 이정표를 나타냅니다.
현재 제한 사항 및 미래 방향
진전에도 불구하고, SIMA 2는 여러 가지 공개된 과제가 있는 연구 프로젝트로 남아 있습니다:
- 장기 과제: 에이전트는 광범위한 다단계 추론과 목표 검증을 요구하는 매우 복잡한 작업에서 여전히 어려움을 겪고 있습니다.
- 메모리 제약: 낮은 지연 시간 상호작용을 유지하기 위해 SIMA 2는 제한된 컨텍스트 창을 사용하며, 이로 인해 상호작용에 대한 기억이 상대적으로 짧습니다.
- 저수준 제어: 복잡한 3D 장면의 강력한 시각적 이해를 달성하고 키보드와 마우스를 통해 정밀한 저수준 행동을 실행하는 것은 여전히 과제로 남아 있습니다.
범용 신체화된 지능에 대한 함의
SIMA 2는 범용적이며 행동 지향적인 AI로 가는 경로를 검증하는 역할을 합니다. Gemini의 추론 능력과 다양한 멀티월드 데이터를 통합하여, Google DeepMind는 물리적 세계에서 미래 AI 어시스턴트의 기본 구성 요소를 만들고자 합니다. 가상 환경에서 배운 기술—내비게이션, 도구 사용, 협업 실행—은 로봇공학에서 지능의 신체화에 필수적인 선행 조건으로 간주됩니다.
SIMA 2는 현재 학자와 게임 개발자의 작은 집단을 대상으로 한 제한된 연구 미리보기로 제공됩니다.