alibaba-damo-academy/RynnBrain
RynnBrain 1.1: Towards More Capable and Generalizable Embodied Foundation Models
解决的问题
RynnBrain 1.1 旨在构建更强大且可泛化的具身基础模型。它弥合了高层视觉-语言理解与机器人物理执行任务之间的差距,使机器人能够更好地理解三维空间、识别交互点,并将指令转化为现实世界中的动作。
工作原理
采用统一的仅解码器视觉-语言架构,提供三种规模(2B、9B 和 122B-A10B)。该模型处理全景视觉输入和语言指令,生成对齐的输出,如文本、指向序列、3D感知数据和接触信号。通过 RynnBrain-VLA,将这些理解转化为适用于多种机器人平台的控制信号,实现感知与行动的桥梁连接。
适用人群
本项目面向从事具身智能研究与开发的机器人研究人员和开发者,特别是那些正在构建面向人形、双臂及灵巧手机器人的视觉-语言-动作(VLA)模型的人员。
主要亮点
- 统一扩展性:提供从 2B 到 122B 稀疏 MoE 模型的多种规模,用于研究具身认知随规模演化的规律。
- 3D 与接触点定位:原生支持 3D 边界框预测和与动作相关的接触点预测,提升交互精度。
- 真实机器人迁移能力:在 Unitree G1 和 Astribot 等不同机器人硬件之间展现出强大的跨平台泛化能力。
- 全面能力支持:包含空间理解、物体定位、可操作性位置识别和轨迹推断的完整手册。
相关
- 项目
- 项目
- 项目
- Dispatch
- 项目