google-research/language-table

Suite of human-collected datasets and a multi-task continuous control benchmark for open vocabulary visuolinguomotor learning.

解決的問題

它解決了創建能夠即時理解並執行各種自然語言指令的機器人的挑戰。具體而言,它旨在實現「開放詞彙」視覺-語言-運動學習,允許機器人根據人類的語音執行複雜的、長程的重排任務(例如用積木拼出一個笑臉)。

工作原理

該專案提供了一個框架,將大規模的語言標註軌跡數據集與多任務連續控制基準測試相結合。透過在這些數據集上使用行為克隆(behavioral cloning)來訓練策略——這些數據集包含了來自真實機器人和模擬環境的數十萬個回合——從而將視覺輸入和語言指令直接映射到運動技能。

適用對象

專為從事機器人技術、具身智能(embodied AI)以及電腦視覺與自然語言處理交叉領域研究的研究人員和開發人員設計。

亮點

  • 海量數據集:包含近 600,000 條跨越真實世界和模擬環境的語言標註軌跡。
  • 高度指令多樣性:支持比以往工作多一個數量級的指令,在 87,000 個獨特的自然語言字串上報告了 93.5% 的成功率。
  • 即時互動:使機器人能夠透過即時語言接受人類引導以實現精確目標。
  • 全面的資產:提供數據集、訓練腳本、環境和預訓練檢查點。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • Dispatch