InternRobotics/InternVLA-A-series
InternVLA-A1: Unifying Understanding, Generation, and Action for Robotic Manipulation
解決的問題
InternVLA-A1.5 透過將三個關鍵能力——視覺-語言理解、視覺預測(預測未來動力學)和動作生成——統一到單個策略中,解決了機器人操作中的組合泛化挑戰。
工作原理
該系統使用 Qwen3.5-2B VLM 作為骨幹網路,透過共享的全注意力層添加輕量級統一動作專家。在訓練期間,它使用可學習的預測 token 從多模態上下文中查詢未來動力學,並由凍結的 WAN2.2-5B 影片生成模型進行監督。在實際部署時,為了保持低延遲,會捨棄影片分支,模型使用 flow matching 來預測連續的動作塊。
適用對象
專為從事機器人操作研究的機器人研究人員和開發人員設計,特別是那些希望提高機器人在不同模擬基準測試(如 RoboTwin、LIBERO 和 SimplerEnv)和真實世界設置中任務泛化能力的人員。
亮點
- 統一架構:將理解、預測和動作結合在一個模型中。
- 潛在預測:在訓練期間使用影片生成模型來教導策略未來的任務動力學。
- 高效推理:在執行時捨棄沉重的影片分支,以確保實際部署的延遲。
- 廣泛的相容性:支援在 LeRobot V2.1 資料集和各種模擬環境中進行微調。
相關
- Dispatch
- 專案
- 專案
- 專案
- 專案