X-Square-Robot/wall-x

Building General-Purpose Robots Based on Embodied Foundation Model

解決的問題

Wall-X 提供一個使用具身基礎模型建構通用機器人的框架。旨在彌合視覺-語言模型(VLM)與物理互動之間的差距,讓機器人能根據高保真互動資料,理解如何在物理世界中有效行動。

工作原理

此專案實作視覺-語言-動作(VLA)架構。利用大規模多模態預訓練,將語言與視覺與特定機器人動作關聯。系統包含專用的訓練與推論堆疊,包括流匹配與 FAST 動作分支,並使用 CUDA 操作符以提升效能。與 LeRobot 資料格式整合,用於資料準備,並支援透過 FSDP(完全分片資料平行)訓練進行微調。

適用對象

本框架專為從事具身人工智慧的機器人研究人員與開發者設計,特別是那些希望部署與微調視覺-語言-動作模型,以用於真實機器人操作與模擬器評估的人。

主要亮點

  • 可部署的 VLA:包含 Wall-OSS-0.5 模型,可直接用於真實機器人操作。
  • 世界動作建模:提供 WALL-WM,結合未來影片想像與動作預測。
  • 整合生態系:提供 LeRobot 資料準備工具、WebSocket 服務用於即時動作推論,以及 LIBERO 模擬器評估工具。
  • 效能優化:使用 FlashAttention 與自訂 CUDA 操作符,確保高效推論與訓練。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案