ZhuoyangLiu2005/T-Rex
Official repository of T-Rex: Tactile-Reactive Dexterous Manipulation
解決的問題
T-Rex 解決了機器人操作中動態觸覺反應缺失的問題。大多數視覺-語言-動作(VLA)模型依賴靜態觸覺編碼器或完全忽略觸覺輸入,而 T-Rex 能夠即時回應高頻觸覺信號,這對於需要精細力控製和操作可變形物體的任務至關重要。
工作原理
- 非同步混合變換器(MoT): 基於 Qwen3-VL-2B 主幹網絡,模型使用三個不同頻率運行的專用專家(潛在、動作、觸覺)。一個「慢速」動作去噪過程(約 5 Hz)處理通用推理,而一個「快速」觸覺精煉過程(約 20 Hz)允許機器人在動作區塊內調整其運動,而無需重新運行整個視覺堆疊。
- 級聯流匹配: 此機制將慢速與快速專家耦合,使策略能動態回應接觸。
- 時序觸覺 VQ-VAE: 一種一維卷積 VQ-VAE 將隨時間變化的高頻力與變形數據進行分詞,使模型能將觸覺信號作為離散令牌處理。
- 三階段訓練: 系統透過大規模無觸覺預訓練、觸覺回應型中段訓練,最後進行任務特定後訓練完成訓練。
適用對象
- 致力於精細操作研究與開發的機器人研究人員與工程師。
- 為接觸密集型任務建構 VLA 模型的開發者。
- 使用 Dexmate Vega-1 或類似雙臂機器人系統的使用者。
主要亮點
- 觸覺回應數據集: 包含 100 小時數據集(50 小時開源),涵蓋 22 種運動原語與 200 多種物體。
- 高頻回應: 在 12 個接觸密集型任務中,平均成功率比強基線高出 30%。
- 嵌入式分詞器: 觸覺 VQ-VAE 可直接嵌入模型,實現對原始觸覺數據的即時編碼。
- 完整堆疊: 提供完整的資料收集堆疊,包括使用 Manus 手套與 VIVE 跟蹤器的遠端操作程式碼。
相關
- 專案
- 專案
- 專案
- 專案