Mistral AI 推出 Robostral Navigate:單一 RGB 相機完成語言導航

2026-07-08

事件摘要

Mistral AI 於 7 月 8 日發表旗下第一個具身導航模型 Robostral Navigate,這是一個 80 億參數的視覺語言動作(VLA)模型,特色是只需要單一顆 RGB 相機作為感測輸入,就能理解自然語言描述的路線指令(例如「沿著走廊走到底,經過第二個路口後左轉」)並轉換成實際的移動動作。在官方公布的基準測試裡,模型達到 76.6% 的任務成功率。

技術意義解讀

這則消息值得放在本站第 6 章 Nav2 導航的脈絡下理解——傳統機器人導航(包括本站教學介紹的 Nav2 完整流程)依賴的是明確的座標目標:使用者或上層系統要先把「去哪裡」轉換成地圖座標系裡的一個具體位置,才能交給 planner_server 規劃路徑。Robostral Navigate 這類模型嘗試打破的正是這個環節——直接把自然語言指令當作輸入,模型內部完成「語言理解 → 環境感知 → 動作決策」的完整映射,不需要事先準備好精確的目標座標。

只靠單一 RGB 相機(而不是本站第 6.2 節介紹的雷射雷達或深度相機)是另一個值得注意的技術選擇——這代表模型必須從純視覺訊號裡,隱式地學會場景理解與空間推理,而不是依賴額外的深度或距離量測硬體,對感測器成本與體積都是有利的方向,但 76.6% 的成功率也說明這類模型距離傳統 SLAM 加上明確座標規劃的可靠度,仍有一段落差,目前更適合定位為輔助或特定情境下的互補方案,而不是取代現有導航技術棧。

相關教學/論文

原文報導