TeleHuman/PRTS
Official Implementation of "PRTS: A Primitive Reasoning and Tasking System via Contrastive Representations"
解決的問題
PRTS(Primitive Reasoning and Tasking System)解決了標準視覺-語言-動作(VLA)模型僅依賴行為克隆的限制。傳統模型學習的是該做什麼,但往往缺乏對當前狀態距離目標有多近的內部理解。PRTS 引入了一種讓模型內化目標可達性感知的方法,使其能更有效地遵循新指令,並在受到干預時更佳地恢復,優於僅透過動作訓練的模型。
工作原理
PRTS 將無獎勵對比強化學習(RL)擴展至 VLA 模型的預訓練階段。它採用 Qwen3-VL 主幹網絡,並與動作損失共同訓練一個對比價值頭。無需人工標註的獎勵標籤或成功標記,而是完全從離線示範軌跡的時間結構中提取監督訊號。這使得模型能夠學習一種語言接地的價值函數,其中狀態-動作與目標嵌入的內積能追蹤目標佔據度,隨著策略接近目標而上升。
適用對象
需要在新指令泛化、長時程任務執行以及不同機器人平台(如雙臂或單臂系統)的真實世界部署中具備更強韌性的視覺-語言-動作模型的機器人研究人員與開發者。
主要亮點
- 無獎勵標籤: 無需每回合的成功標籤或精心整理的獎勵資料集,即可學習目標可達性。
- 目標可達性感知: 直接將對比價值頭整合至主幹網絡中,使模型能理解向目標推進的進展。
- 高效率: 使用自訂的 CuTe-FlashAttention 內核,將預訓練計算成本維持在普通行為克隆的水準附近。
- 強泛化能力: 在模擬與真實世界環境中,顯著優於以往的 VLA 模型,在新指令遵循與分佈外任務上表現更佳。
相關
- 專案
- 專案
- 專案
- 專案