Mistral AI Robostral Navigate 8B 模型实现单摄像头具身导航

TL;DR

Mistral AI 发布了 Robostral Navigate,这是一款 8 B 参数模型,使用单个 RGB 摄像头进行机器人导航,在未见过的 R2R‑CE 基准上实现 76.6% 的成功率——比最佳单摄像头系统高出 9.7 分,比最佳多传感器系统高出 4.5 分。该模型完全在仿真中训练,采用新颖的指向式策略,并可在轮式、足式和飞行平台上运行。


先进水平基准性能

Robostral Navigate 在 Room‑to‑Room in Continuous Environments (R2R‑CE) 基准的 已见验证 79.4% 成功率未见验证 76.6% 成功率 上取得了成绩。尽管仅使用单个普通 RGB 摄像头,但其表现比之前最佳的单摄像头方法高出 9.7 个百分点,并比最强的深度或多摄像头系统高出 4.5 个点

"Robostral Navigate 只使用一个普通 RGB 摄像头且没有深度传感器,却仍在 R2R‑CE 未见验证中实现了 76.6%" – Mistral AI 博客。

该结果表明,大规模仿真数据和高效的 token 训练可以取代许多室内导航任务中昂贵的传感器套件。


极简传感器堆栈:单摄像头,无 LiDAR

模型的 单摄像头设计 消除了对 LiDAR、深度摄像头或多摄像头装置的需求。通过预测下一目标点的图像空间坐标(即“指向”动作),策略对相机内参和世界尺度的变化保持鲁棒。当目标位于视野之外时,模型会回退到局部位移指令(例如 “向前移动 2 m,向左移动 1.5 m”)。

“指向使得策略天然对相机内参和世界尺度的变化保持鲁棒” – Mistral AI。

社区见解

“暗示(且我希望这是真的)这是一种无地图导航。令人印象深刻。如果事先有环境的预先捕获地图,这类任务会容易得多……” – iandanforth(Hacker News)


训练流水线与效率

Robostral Navigate 完全 内部自行构建,不依赖现有的开源视觉语言模型。它基于 Mistral 为定位(指向、计数、对象定位)专门化的视觉语言模型,并将其扩展到导航。

  • 数据生成:约 40 万条轨迹,遍及 6 千个模拟场景,全部在自定义仿真流水线中创建。
  • 前缀缓存:基于树的注意力掩码将整个回合压缩为单个序列,使模型能够在一次前向传播中处理所有时间步,同时防止信息泄漏。这将 token 数量降低了 22 倍,并将训练时间从数月缩短至数天。
  • 在线强化学习(CISPO):在监督预训练之后,模型使用在线 RL 算法进行微调,使成功率提升 3.2 个百分点,并缓解分布漂移。

跨平台泛化能力

该模型可在 轮式、足式和飞行机器人 上运行,并对机器人尺寸和相机内参的变化保持鲁棒。这种平台无关的能力直接来源于先行仿真数据生成以及抽象的图像空间指向表示。


真实世界演示

Mistral 的视频展示了一台机器人在繁忙的办公室中执行长时程指令,绕过训练中从未见过的人和障碍物进行导航。演示以 2 倍速 播放,这是机器人研究中常用的展示平滑运行的做法。

“Robostral Navigate 在工作办公室中通过一条长时程指令路线全自主运行” – Mistral AI。

社区怀疑

“R2R‑CE 是由模拟环境组成的基准。因此,击败该基准的意义大致相当于让机器人玩 Minecraft ……” – YeGoblynQueenne(Hacker News)


限制与未解问题

  • 无地图导航:博客未明确说明模型是否构建内部地图或仅依赖反应式指向。社区推测它是无地图运行,但细节缺乏。
  • 物理鲁棒性:演示环境整洁;在杂乱、动态的真实环境中处理仍是未解挑战。
  • 集成细节:博客未说明指向输出如何转化为低层电机指令。社区有请求希望澄清此点。

“博客没有提供足够细节,如果有人能阐明指向动作如何转化为低层机器人运动指令,那就太好了!” – mosfets(Hacker News)


对爱好者和研究者的潜力

截至撰写时,该模型 未公开发布。多位评论者对爱好者项目的可获取性表示疑问。

“这看起来并非公开可用的模型,但如果是的话,易用的单摄像头导航设置将能促成许多酷炫的爱好者项目。” – humanperhaps

“获取并玩转它的现实路径是什么?我很想把它接到 OpenClaw 上进行爱好者探索 ……” – HanClinto

Mistral 表示对商业合作感兴趣并正在招聘机器人领域人才,这暗示早期访问可能仅限于企业合作伙伴。


展望

Robostral Navigate 标志着 迈向统一具身 AI 代理的第一步,该代理能够以最小的感知在复杂的室内外空间中导航。通过结合大规模仿真、高效训练以及以定位为先的视觉语言模型,Mistral 展示了高性能导航并不需要笨重的传感器套件。

未来工作可能聚焦于:

  1. 将模型扩展到 操作任务(抓取、对象交互),这将需要额外的感知模态。
  2. 在多样、杂乱的真实环境中进行 实地评估,以验证仿真到真实的迁移。
  3. 为学术界和爱好者提供 开源或授权途径

参考文献

  • Mistral AI 博客文章:Robostral Navigate: single‑camera AI navigationhttps://mistral.ai/news/robostral-navigate/
  • R2R‑CE 基准描述(Room‑to‑Room in Continuous Environments)。
  • CISPO 强化学习算法(如 Mistral 所引用)。

本文综合了官方公告以及来自 Hacker News(帖子 ID 48832212)的社区评论。

Sources

相关

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch