Robostral Navigate 發佈說明

Mistral AI 已宣布推出 Robostral Navigate,這是一款專為具身導航(embodied navigation)設計的 8B 模型,讓機器人僅透過單一 RGB 相機和自然語言指令即可在複雜環境中移動。此模型在保持更高效率的同時,表現優於現有的多感測器方法——包括使用 LiDAR 或深度感測器的方案。

性能基準測試

Robostral Navigate 在 Room-to-Room in Continuous Environments (R2R-CE) 基準測試中達到了尖端性能,該測試衡量在訓練期間未見過的環境中遵循指令的能力。

  • Validation Unseen: 76.6% 成功率。
  • Validation Seen: 79.4% 成功率。

這些結果比最佳的單相機方法領先 9.7 分,並比使用深度感測器或多相機的最佳系統領先 4.5 分。

導航方法論:指向與位移

Robostral Navigate 利用「指向」(pointing)機制來預測下一次移動。模型會推斷當前相機視圖內目標位置的圖像座標,並確定抵達時所需的朝向。這種方法使策略對於世界尺度和相機內參的變化具有魯棒性。

當目標位置位於當前視野之外時,模型會退而使用局部座標系位移,提供具體的指令,例如向前或向左移動特定米數,並轉向特定角度。

模型架構與訓練

Robostral Navigate 完全由內部開發,初始化自一個專門用於物件定位、計數和指向等接地任務(grounding tasks)的視覺語言模型。

數據生成

該模型完全在模擬環境中進行訓練,使用自定義的數據生成流水線,在 350,000 個場景中產生了約 240 萬條軌跡。

監督式訓練效率

為了優化訓練,Mistral AI 實施了使用基於樹狀注意力遮罩策略(tree-based attention-masking strategy)的 prefix-caching 演算法。這種方法將整個回合(episode)壓縮成單個序列,使模型能夠在單次前向傳播中訓練所有時間步。這將訓練標記(tokens)的數量減少了 22 倍,將訓練週期從數月縮短至數天。

在線強化學習

在監督式訓練之後,使用 CISPO(一種在線強化學習演算法)進一步增強了模型的性能。這讓模型能夠從試錯中學習並從失敗中恢復,從而將成功率提高了 3.2%,並緩解了與傳統行為複製(behavior cloning)相關的分佈偏移問題。

硬體通用性與應用

Robostral Navigate 設計為與硬體無關,無論機器人的大小,皆可運行於輪式、足式和飛行機器人上。由於它僅依賴單一 RGB 相機,因此適用於各種場景,包括辦公室、住宅建築、商業空間和戶外環境。Mistral AI 將這些能力視為製造業、配送、物流和餐飲業應用的關鍵。

Sources

相關

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch