PKU-EPIC/GraspVLA

[CoRL25] GraspVLA: a Grasping Foundation Model Pre-trained on Billion-scale Synthetic Action Data

解決的問題

GraspVLA 解決了訓練機器人抓取模型所面臨的高成本與資料稀缺問題。它讓機器人能在無需昂貴的真實世界微調的情況下,對現實世界中的多樣化物體執行開放詞彙抓取,實現直接的模擬到現實的轉移。

工作原理

此專案包含三個主要組件:

  1. SynGrasp-1B:一個龐大的合成資料集,包含 240 種物體類別與超過 10,000 種物體的 10 億幀抓取資料。
  2. GraspVLA 模型:一個在合成資料上預訓練的視覺-語言-動作(VLA)模型。它使用統一的思考鏈(CoT)框架,將自回歸感知(預測邊界框與目標)與基於流匹配的動作生成結合。
  3. 混合訓練:模型在合成動作資料與網際網路規模的語義資料上進行訓練,使其能理解並執行開放詞彙命令。

適用對象

從事機器人操作、模擬到現實轉移以及具身智能基礎模型的機器人研究人員與開發者。

主要亮點

  • 零樣本泛化:在合成預訓練後,無需額外微調即可抓取現實世界物體。
  • 十億級資料:利用 SynGrasp-1B 資料集,提供大量多樣化的訓練範例。
  • 高效推理:在 NVIDIA RTX L40s 上使用約 9GB GPU 內存,實現 200ms 推理延遲。
  • 整合推理:透過 CoT 框架將感知與動作整合為單一推理過程。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案