alibaba-damo-academy/RynnBrain
RynnBrain 1.1: Towards More Capable and Generalizable Embodied Foundation Models
解決的問題
RynnBrain 1.1 的設計目標是建立更具能力且可泛化的具身基礎模型。它彌補了高階視覺-語言理解與機器人物理執行任務之間的差距,使機器人能更佳理解三維空間、識別互動點,並將指令轉化為現實世界的動作。
工作原理
採用統一的僅解碼器視覺-語言架構,提供三種規模(2B、9B 和 122B-A10B)。模型處理全向視覺輸入與語言指令,產生對齊的輸出,例如文字、指向序列、3D感知資料與接觸信號。透過 RynnBrain-VLA,將這些理解轉化為適用於各種機器人平台的控制信號,實現感知與行動的橋接。
適用對象
本專案適用於從事具身智能研究與開發的機器人研究人員與開發者,特別是那些正在建構面向人形、雙手及靈巧手機器人的視覺-語言-行動(VLA)模型的人員。
主要亮點
- 統一擴展性:提供從 2B 到 122B 稀疏 MoE 模型的多種規模,用於研究具身認知隨規模演化的規律。
- 3D 與接觸點定位:原生支援 3D 界定框預測與與動作相關的接觸點預測,提升互動精準度。
- 真實機器人遷移能力:在 Unitree G1 與 Astribot 等不同機器人硬體之間展現強大的跨平台泛化能力。
- 全面能力支援:包含空間理解、物件定位、可操作性位置識別與軌跡推論的完整手冊。
相關
- 專案
- 專案
- 專案
- Dispatch
- 專案