ZhuoyangLiu2005/T-Rex
Official repository of T-Rex: Tactile-Reactive Dexterous Manipulation
解决的问题
T-Rex 解决了机器人操作中动态触觉反应缺失的问题。大多数视觉-语言-动作(VLA)模型依赖静态触觉编码器或完全忽略触觉输入,而 T-Rex 能够实时响应高频触觉信号,这对于需要精细力控制和操作可变形物体的任务至关重要。
工作原理
- 异步混合变换器(MoT): 基于 Qwen3-VL-2B 主干网络,模型使用三个不同频率运行的专用专家(潜在、动作、触觉)。一个“慢速”动作去噪过程(约 5 Hz)处理通用推理,而一个“快速”触觉精炼过程(约 20 Hz)允许机器人在动作块内调整其运动,而无需重新运行整个视觉堆栈。
- 级联流匹配: 该机制将慢速和快速专家耦合,使策略能够动态响应接触。
- 时序触觉 VQ-VAE: 一种一维卷积 VQ-VAE 将随时间变化的高频力和形变数据进行分词,使模型能够将触觉信号作为离散令牌处理。
- 三阶段训练: 系统通过大规模无触觉预训练、触觉响应型中段训练,最后进行任务特定后训练完成训练。
适用人群
- 从事精细操作研究与开发的机器人研究人员和工程师。
- 为接触密集型任务构建 VLA 模型的开发者。
- 使用 Dexmate Vega-1 或类似双臂机器人系统的用户。
主要亮点
- 触觉响应数据集: 包含 100 小时数据集(50 小时开源),涵盖 22 种运动原语和 200 多种物体。
- 高频响应: 在 12 个接触密集型任务中,平均成功率比强基线高出 30%。
- 嵌入式分词器: 触觉 VQ-VAE 可直接嵌入模型,实现对原始触觉数据的实时编码。
- 完整堆栈: 提供完整的数据采集堆栈,包括使用 Manus 手套和 VIVE 跟踪器的遥操作代码。
相关
- 项目
- 项目
- 项目
- 项目