open-gigaai/giga-brain-0

GigaBrain-0: A World Model-Powered Vision-Language-Action Model

解決的問題

訓練通用機器人通常需要大量真實世界資料,而這些資料的收集成本高且耗時。GigaBrain-0 透過使用世界模型大規模生成合成資料,減少對真實世界機器人資料的依賴,同時提升模型在不同任務、物體擺放與相機視角之間的泛化能力。

工作原理

GigaBrain-0 是一個視覺-語言-行動(VLA)基礎模型。它結合真實世界機器人資料與由世界模型生成的大規模合成資料。為提升穩健性與推理能力,模型引入了 RGBD(顏色與深度)輸入建模與具身 Chain-of-Thought(CoT)監督,使模型能在任務執行過程中推理空間幾何與長時序依賴關係。

適用對象

從事具身人工智慧與機器人研究的科研人員與開發者,特別是希望在不完全依賴真實世界資料收集的前提下擴展 VLA 模型的使用者。

主要亮點

  • 世界模型資料引擎:利用合成資料生成實現訓練規模擴展與跨任務泛化能力提升。
  • 具身 CoT:實現空間幾何與物體狀態的 Chain-of-Thought 推理。
  • 支援 RGBD:建模深度資訊以增強策略穩健性。
  • 高性能量表現:GigaBrain-0.1 版本在 RoboChallenge 排行榜上獲得第一名。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案