google-research/language-table

Suite of human-collected datasets and a multi-task continuous control benchmark for open vocabulary visuolinguomotor learning.

解決する課題

リアルタイムで多種多様な自然言語の指示を理解し、実行できるロボットを開発するという課題に対処します。具体的には、「オープンボキャブラリー」な視覚言語運動学習を可能にすることを目指しており、ロボットが人間の発話に基づいて、複雑で長期的な再配置タスク(例:ブロックを使ってスマイルマークを作るなど)を実行できるようにします。

仕組み

このプロジェクトは、言語アノテーションが付与された大規模な軌跡データセットと、マルチタスク連続制御ベンチマークを組み合わせたフレームワークを提供します。実機ロボットとシミュレーションの両方から得られた数十万のエピソードを含むこれらのデータセットを用い、行動クローニング(behavioral cloning)によってポリシーを訓練し、視覚入力と言語コマンドを直接運動スキルへとマッピングします。

対象者

ロボット工学、エンボディドAI(embodied AI)、およびコンピュータビジョンと自然言語処理の交差点領域で活動する研究者や開発者向けに設計されています。

ハイライト

  • 大規模データセット: 実世界およびシミュレーション環境における、約60万件の言語ラベル付き軌跡が含まれています。
  • 高いコマンド多様性: 従来の研究よりも桁違いに多いコマンドをサポートしており、87,000個のユニークな自然言語文字列に対して93.5%の成功率を報告しています。
  • リアルタイム・インタラクション: 人間がリアルタイムの言語を通じてロボットを誘導し、正確な目標を達成することを可能にします。
  • 包括的なアセット: データセット、トレーニングスクリプト、環境、および学習済みチェックポイントを提供します。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • Dispatch