TeleHuman/PRTS
Official Implementation of "PRTS: A Primitive Reasoning and Tasking System via Contrastive Representations"
解决的问题
PRTS(Primitive Reasoning and Tasking System)解决了标准视觉-语言-动作(VLA)模型仅依赖行为克隆的局限性。传统模型学习的是该做什么,但往往缺乏对当前状态距离目标有多近的内部理解。PRTS 引入了一种让模型内化目标可达性感知的方法,使其能够更有效地遵循新指令,并在受到干预时更好地恢复,优于仅通过动作训练的模型。
工作原理
PRTS 将无奖励对比强化学习(RL)扩展到 VLA 模型的预训练阶段。它采用 Qwen3-VL 主干网络,并与动作损失共同训练一个对比价值头。无需人工标注的奖励标签或成功标记,而是完全从离线演示轨迹的时间结构中提取监督信号。这使得模型能够学习一种语言接地的价值函数,其中状态-动作与目标嵌入的内积能够追踪目标占据度,随着策略接近目标而上升。
适用人群
需要在新指令泛化、长时程任务执行以及不同机器人平台(如双臂或单臂系统)的真实世界部署中具备更强鲁棒性的视觉-语言-动作模型的机器人研究人员和开发者。
主要亮点
- 无奖励标签: 无需每轮的成功标签或精心整理的奖励数据集,即可学习目标可达性。
- 目标可达性感知: 直接将对比价值头集成到主干网络中,使模型能够理解向目标推进的进展。
- 高效率: 使用自定义的 CuTe-FlashAttention 内核,将预训练计算成本保持在普通行为克隆的水平附近。
- 强泛化能力: 在模拟和真实世界环境中,显著优于以往的 VLA 模型,在新指令遵循和分布外任务上表现更佳。
相关
- 项目
- 项目
- 项目
- 项目