Robbyant/lingbot-vla-v2

From Foundation to Application

解決的問題

LingBot-VLA 2.0 是一個為彌合大規模預訓練與可靠現實世界機器人應用之間差距而設計的視覺-語言-動作(VLA)基礎模型。它解決了在不同機器人類型(身體形態)和任務之間實現泛化,同時在模擬與真實世界環境中保持高性能量的挑戰。

工作原理

該模型使用了一個包含 60,000 小時資料的大規模預訓練語料庫,其中包括 50,000 小時的機器人軌跡和 10,000 小時的自我中心人類影片。它採用了多項關鍵技術革新:

  • 統一的動作表示:將多種機器人配置映射到一個 55 維的標準狀態/動作向量中,涵蓋手臂、末端執行器、夾爪、靈巧手、腰部、頭部和移動基座。
  • MoE 動作專家:在動作專家中使用稀疏的專家混合(MoE)層,使通用先驗知識與特定身體形態/任務模式共存。
  • 雙查詢蒸餾:從 LingBot-Depth 和 DINO-Video 中蒸餾感知查詢,以捕捉當前場景的幾何結構和未來場景的演化(預測動力學建模)。

適用對象

本項目適用於希望部署可在多種硬體配置上運行並執行複雜操作任務的通用機器人策略的機器人研究人員和開發者。

主要亮點

  • 廣泛泛化:在涵蓋 20 種不同機器人配置的大規模資料集上進行訓練。
  • 擴展的動作空間:支援超出標準雙臂操作的廣泛機器人組件。
  • 高性能量:在 GM-100 雙臂操作和長時程移動操作基準測試中,優於以往版本及競爭對手。
  • 真實世界就緒:包含用於模擬(RoboTwin)和真實世界機器人的部署腳本,使用 RTX 4090D 推論時間約為 130ms。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案