InternRobotics/InternVLA-A-series

InternVLA-A1: Unifying Understanding, Generation, and Action for Robotic Manipulation​

解決する課題

InternVLA-A1.5は、視覚と言語の理解、視覚的予測(将来のダイナミクスの予測)、およびアクション生成という3つの重要な能力を単一のポリシーに統合することで、ロボット操作における構成的汎化の課題に対処します。

仕組み

このシステムは、Qwen3.5-2B VLMをバックボーンとして使用し、共有フルアテンション層を介して軽量な統合アクションエキスパートを追加します。トレーニング中には、学習可能な予測トークンを使用してマルチモーダルなコンテキストから将来のダイナミクスを照会し、凍結されたWAN2.2-5Bビデオ生成モデルによって監督されます。実際のデプロイメントでは、低レイテンシを維持するためにビデオブランチは破棄され、モデルはflow matchingを使用して連続的なアクションチャンクを予測します。

対象者

ロボット操作に取り組むロボット研究者および開発者、特に、異なるシミュレーションベンチマーク(RoboTwin、LIBERO、SimplerEnvなど)や実世界の環境において、ロボットがいかにタスクを汎化させるかを向上させようとしている方を対象としています。

ハイライト

  • 統合アーキテクチャ: 理解、予測、アクションを一つのモデルに結合。
  • 潜在的予測: トレーニング中にビデオ生成モデルを使用して、将来のタスクダイナミクスについてポリシーに学習させる。
  • 効率的な推論: 実行時に重いビデオブランチを破棄し、実用的なデプロイメントレイテンシを確保。
  • 幅広い互換性: LeRobot V2.1 データセットや様々なシミュレーション環境でのファインチューニングをサポート。

関連

  • Dispatch
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト