alibaba-damo-academy/RynnBrain

RynnBrain 1.1: Towards More Capable and Generalizable Embodied Foundation Models

何を解決するか

RynnBrain 1.1 は、より強力で汎用性の高い身体的基礎モデルを構築することを目的としています。ロボットが高レベルの視覚言語理解から物理的なタスク実行へと移行するギャップを埋め、3D空間をよりよく理解し、インタラクションポイントを特定し、指示を現実世界の行動に変換できるようにします。

仕組み

統一されたデコーダー専用の視覚言語アーキテクチャを採用しており、3つのスケール(2B、9B、122B-A10B)で利用可能です。モデルはオムニビジョン入力と言語指示を処理し、テキスト、ポイントシーケンス、3D認識データ、接触信号などの整合された出力を生成します。RynnBrain-VLAを通じて、この理解をさまざまなロボットプラットフォーム向けの制御信号に変換することで、知覚と行動を橋渡しします。

対象ユーザー

本プロジェクトは、身体的知能の研究・開発に従事するロボット工学研究者や開発者を対象としており、特に人間型、両手型、精密ハンドロボット向けの視覚言語行動(VLA)モデルを構築している方々に適しています。

主な特徴

  • 統一されたスケーリング: 2Bから122BのスパースMoEモデルまで、スケールに応じたモデルを提供し、身体的認知のスケーリングにおける進化を研究可能にします。
  • 3Dおよび接触の基盤: タスクに関連するインタラクションに適した、ネイティブな3Dバウンディングボックス予測と接触ポイント予測をサポートします。
  • 実機ロボットへの転移: Unitree G1 や Astribot など、異なるロボットハードウェア間で強力なクロスプラットフォーム一般化を実証しています。
  • 包括的な機能: 空間理解、オブジェクトの基盤、アフォーダンスの位置、軌道推論に関するレシピブックを含んでいます。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • Dispatch
  • プロジェクト