alibaba-damo-academy/RynnBrain
RynnBrain 1.1: Towards More Capable and Generalizable Embodied Foundation Models
해결하는 문제
RynnBrain 1.1은 더 강력하고 일반화 가능한 신체 기반 기초 모델을 만드는 것을 목표로 합니다. 고수준의 시각-언어 이해와 로봇의 물리적 작업 수행 사이의 격차를 해소하여, 로봇이 3D 공간을 더 잘 이해하고 상호작용 지점을 식별하며 지시를 현실 세계의 행동으로 변환할 수 있도록 합니다.
작동 방식
일관된 디코더 전용 시각-언어 아키텍처를 사용하며, 2B, 9B, 122B-A10B 세 가지 규모로 제공됩니다. 모델은 옴니비전 입력과 언어 지시를 처리하여 텍스트, 포인터 시퀀스, 3D 인식 데이터, 접촉 신호와 같은 일치된 출력을 생성합니다. RynnBrain-VLA를 통해 이러한 이해를 다양한 로봇 플랫폼용 제어 신호로 변환함으로써 지각과 행동을 연결합니다.
대상 사용자
본 프로젝트는 신체적 지능 연구 및 개발에 종사하는 로봇 연구자 및 개발자, 특히 인간형, 이중손, 정교한 손 로봇을 위한 시각-언어-행동(VLA) 모델을 구축하는 사람들에게 적합합니다.
주요 특징
- 통합적 확장성: 2B에서 122B 스파스-MoE 모델까지 다양한 규모의 모델을 제공하여 신체적 인지가 규모에 따라 어떻게 진화하는지 연구할 수 있습니다.
- 3D 및 접촉 기반: 작업에 관련된 상호작용을 위한 네이티브 3D 경계 상자 예측과 접촉 지점 예측을 지원합니다.
- 실제 로봇으로의 전이: Unitree G1 및 Astribot과 같은 다양한 로봇 하드웨어 간에 강력한 크로스플랫폼 일반화를 보여줍니다.
- 포괄적인 기능: 공간 이해, 객체 기반, 가능성을 찾는 위치, 궤적 추론을 위한 요리책을 포함합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- Dispatch
- 프로젝트