InternRobotics/VLAC

VLAC: A Vision-Language-Action-Critic Model for Robotic Real-World Reinforcement Learning

解決的問題

VLAC 旨在改善真實世界機器人強化學習與資料精煉。它解決了在機器人操作任務中提供密集且準確的獎勵回饋,以及過濾低品質軌跡的挑戰,這在傳統方法中通常難以達成。

運作原理

VLAC 是一種視覺-語言-動作-評論家模型,透過大量的人類第一人稱視角資料、公開機器人操作資料與自行收集的資料進行訓練。它使用成對比較機制來評估任務進度並辨識影格之間的狀態變化。透過結合影像輸入與任務描述,該模型能夠預測任務進度、驗證任務完成情況,並區分成功與失敗的動作。

適用對象

此專案適用於從事具身智慧研究的機器人研究人員與開發者,特別是那些專注於強化學習、模仿學習,以及需要高品質軌跡資料來訓練機器人的人員。

亮點

  • 成對比較:提升密集評論家獎勵與狀態變化辨識的準確度。
  • 多模態能力:支援過程追蹤、任務完成判斷、VQA 與具身動作輸出。
  • 零樣本/單樣本泛化:在未經額外訓練的情況下,仍能在新實體、場景與任務中保持效能。
  • 軌跡品質篩選:過濾低分軌跡並遮蔽負面動作,以提升模仿學習效率。
  • 人類-任務共感覺:利用人類第一人稱視角資料 (Ego4D) 來更好地理解真實世界的人類任務。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案