InternRobotics/VLAC
VLAC: A Vision-Language-Action-Critic Model for Robotic Real-World Reinforcement Learning
解決的問題
VLAC 旨在改善真實世界機器人強化學習與資料精煉。它解決了在機器人操作任務中提供密集且準確的獎勵回饋,以及過濾低品質軌跡的挑戰,這在傳統方法中通常難以達成。
運作原理
VLAC 是一種視覺-語言-動作-評論家模型,透過大量的人類第一人稱視角資料、公開機器人操作資料與自行收集的資料進行訓練。它使用成對比較機制來評估任務進度並辨識影格之間的狀態變化。透過結合影像輸入與任務描述,該模型能夠預測任務進度、驗證任務完成情況,並區分成功與失敗的動作。
適用對象
此專案適用於從事具身智慧研究的機器人研究人員與開發者,特別是那些專注於強化學習、模仿學習,以及需要高品質軌跡資料來訓練機器人的人員。
亮點
- 成對比較:提升密集評論家獎勵與狀態變化辨識的準確度。
- 多模態能力:支援過程追蹤、任務完成判斷、VQA 與具身動作輸出。
- 零樣本/單樣本泛化:在未經額外訓練的情況下,仍能在新實體、場景與任務中保持效能。
- 軌跡品質篩選:過濾低分軌跡並遮蔽負面動作,以提升模仿學習效率。
- 人類-任務共感覺:利用人類第一人稱視角資料 (Ego4D) 來更好地理解真實世界的人類任務。
相關
- 專案
- 專案
- 專案
- 專案
- 專案