Robostral Navigate 发布说明

Mistral AI 宣布推出 Robostral Navigate,这是一个 8B 参数的模型,专为具身导航设计,使机器人仅通过单个 RGB 摄像头和自然语言指令即可在复杂环境中移动。该模型在保持更高效率的同时,性能优于现有的多传感器方法(包括使用 LiDAR 或深度传感器的方案)。

性能基准测试

Robostral Navigate 在连续环境中的房间到房间(Room-to-Room in Continuous Environments, R2R-CE)基准测试中达到了最先进水平,该测试衡量模型在训练期间未见过的环境中遵循指令的能力。

  • 验证集未见场景: 76.6% 成功率。
  • 验证集已见场景: 79.4% 成功率。

这些结果相较于最佳单摄像头方法领先 9.7 个百分点,相较于使用深度传感器或多个摄像头的最佳系统领先 4.5 个百分点。

导航方法:指向与位移

Robostral Navigate 使用“指向”机制来预测下一步移动。该模型推断当前摄像头视图中目标位置的图像坐标,并确定到达时的理想朝向。这种方法使策略对世界尺度和相机内参的变化具有鲁棒性。

当目标位置超出当前视野范围时,模型会退回到局部坐标系中的位移指令,提供诸如“向前移动若干米”或“向左移动并旋转特定角度”等具体指令。

模型架构与训练

Robostral Navigate 完全由 Mistral AI 内部构建,初始模型基于一个专注于定位任务(如物体定位、计数和指向)的视觉-语言模型。

数据生成

该模型完全在仿真环境中训练,使用自定义的数据生成流水线,共生成了约 240 万个轨迹,覆盖 35 万个场景。

监督训练效率

为优化训练,Mistral AI 实现了一种基于树结构的注意力掩码策略的前缀缓存算法。该方法将整个 episode 压缩为单个序列,使模型能够在一次前向传播中训练所有时间步。这将训练 token 数量减少了 22 倍,将训练周期从数月缩短至数天。

在线强化学习

在监督训练之后,模型性能通过 CISPO(一种在线强化学习算法)进一步提升。该算法使模型能够从试错中学习并从失败中恢复,成功率达到 3.2% 的提升,并缓解了传统行为克隆方法存在的分布偏移问题。

硬件泛化与应用

Robostral Navigate 设计为硬件无关,可在轮式、腿式和飞行机器人上运行,无论其尺寸大小。由于仅依赖单个 RGB 摄像头,该模型适用于多种场景,包括办公室、住宅建筑、商业空间和户外环境。Mistral AI 认为这些能力对于制造、配送、物流和酒店服务等应用至关重要。

Sources

相关

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch