Robostral Navigate 发布说明
Mistral AI 宣布推出 Robostral Navigate,这是一个 8B 参数的模型,专为具身导航设计,使机器人仅通过单个 RGB 摄像头和自然语言指令即可在复杂环境中移动。该模型在保持更高效率的同时,性能优于现有的多传感器方法(包括使用 LiDAR 或深度传感器的方案)。
性能基准测试
Robostral Navigate 在连续环境中的房间到房间(Room-to-Room in Continuous Environments, R2R-CE)基准测试中达到了最先进水平,该测试衡量模型在训练期间未见过的环境中遵循指令的能力。
- 验证集未见场景: 76.6% 成功率。
- 验证集已见场景: 79.4% 成功率。
这些结果相较于最佳单摄像头方法领先 9.7 个百分点,相较于使用深度传感器或多个摄像头的最佳系统领先 4.5 个百分点。
导航方法:指向与位移
Robostral Navigate 使用“指向”机制来预测下一步移动。该模型推断当前摄像头视图中目标位置的图像坐标,并确定到达时的理想朝向。这种方法使策略对世界尺度和相机内参的变化具有鲁棒性。
当目标位置超出当前视野范围时,模型会退回到局部坐标系中的位移指令,提供诸如“向前移动若干米”或“向左移动并旋转特定角度”等具体指令。
模型架构与训练
Robostral Navigate 完全由 Mistral AI 内部构建,初始模型基于一个专注于定位任务(如物体定位、计数和指向)的视觉-语言模型。
数据生成
该模型完全在仿真环境中训练,使用自定义的数据生成流水线,共生成了约 240 万个轨迹,覆盖 35 万个场景。
监督训练效率
为优化训练,Mistral AI 实现了一种基于树结构的注意力掩码策略的前缀缓存算法。该方法将整个 episode 压缩为单个序列,使模型能够在一次前向传播中训练所有时间步。这将训练 token 数量减少了 22 倍,将训练周期从数月缩短至数天。
在线强化学习
在监督训练之后,模型性能通过 CISPO(一种在线强化学习算法)进一步提升。该算法使模型能够从试错中学习并从失败中恢复,成功率达到 3.2% 的提升,并缓解了传统行为克隆方法存在的分布偏移问题。
硬件泛化与应用
Robostral Navigate 设计为硬件无关,可在轮式、腿式和飞行机器人上运行,无论其尺寸大小。由于仅依赖单个 RGB 摄像头,该模型适用于多种场景,包括办公室、住宅建筑、商业空间和户外环境。Mistral AI 认为这些能力对于制造、配送、物流和酒店服务等应用至关重要。
Sources
- OriginalIntroducing Robostral Navigate
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch