Visual SLAM vs LiDAR SLAM:機器人建圖該靠攝影機還是雷射雷達

2026-09-09

建地圖,靠幾何量測還是靠影像特徵

機器人要建立環境地圖並同時定位自己在地圖中的位置(SLAM),核心感測器選擇長期存在兩條路線的競爭——LiDAR SLAM 靠雷射測距直接取得精確的幾何距離資訊,Visual SLAM(如本站在 ORB-SLAM 論文導讀 中介紹的方法)靠攝影機拍到的影像特徵點推算相機的運動與環境結構。兩條路線的核心差異,本質上跟本站在單目、雙目、RGB-D 相機比較一文中討論的直接量測 vs 間接推算的取捨,是同一個問題在建圖層次的延伸。

LiDAR SLAM:精度穩定,但成本與資訊維度受限

光達直接主動發射雷射並量測反射時間,取得的距離資訊不需要透過演算法間接推算,這讓 LiDAR SLAM 在幾何精度與光線穩健度上具備天生優勢——不論白天黑夜,只要沒有極端天氣干擾(本站在 LiDAR vs Radar vs 攝影機 一文中提到的大雨、濃霧散射問題),光達的測距表現都相對穩定一致。

但光達點雲本質上只有幾何形狀資訊,沒有顏色、紋理這類語意線索,這在兩個層面會造成限制:一是迴路閉合判斷相對困難——當環境裡存在多個幾何形狀相似的區域(例如倉庫裡外觀相同的貨架走道),純粹依賴點雲幾何比對容易誤判「這是同一個地方」;二是無法直接支援需要物體辨識、場景語意理解的下游應用,如果任務需要機器人理解「這是一張桌子」而不只是「這裡有一個平面」,光達點雲本身無法提供這層資訊,需要額外疊加視覺或其他語意感測器。

Visual SLAM:資訊豐富、成本低,但光線與紋理是天生弱點

視覺 SLAM 靠影像特徵點的跨幀匹配估計相機運動,同時利用影像的顏色與紋理資訊,天生具備比光達點雲更豐富的場景語意內容,這也是為什麼需要物體辨識、場景理解的應用(例如服務型機器人辨識「這是客廳還是廚房」)多半以視覺方案為主要感知來源。成本與體積優勢也很明顯——攝影機模組遠比光達便宜輕巧,這對無人機、小型服務機器人這類酬載敏感平台是重要考量。

弱點也很直接:光線不足或缺乏紋理的環境(昏暗走廊、純色牆面)會讓可用特徵點大幅減少,直接影響定位精度與穩定性;純視覺方案(尤其是單目)取得的深度資訊也是透過運動視差等間接方式推算而來,精度天花板不如光達直接量測。

融合路線:讓光達管幾何、視覺管語意與迴路閉合

愈來愈多系統不把 LiDAR SLAM 與 Visual SLAM 視為互斥的二選一,而是在同一個 SLAM 框架裡融合兩種感測器的觀測資訊——光達提供精確穩定的幾何距離量測,視覺提供迴路閉合判斷所需要的豐富特徵比對能力,以及光達點雲本身無法提供的場景語意資訊。這種融合設計,本質上跟本站在LiDAR vs Radar vs 攝影機一文中討論的自駕感測器融合邏輯相通——不同感測器的失效條件互補,融合後的系統穩健度高於任何單一感測器獨立運作,這也是為什麼中高階移動機器人與自駕車平台,即使多花費硬體成本,仍然普遍選擇同時搭載光達與視覺感測器,而非只押注單一種技術路線。

選擇的核心:任務需要精確幾何,還是需要場景語意

決定該偏重 LiDAR SLAM 還是 Visual SLAM,核心問題是任務更看重哪一種資訊——如果任務只需要精確的路徑規劃與避障(多數工業 AMR 場景),光達的精確幾何量測已經足夠,且不受光線影響的穩定性更符合工業部署的可靠度要求;如果任務需要理解場景語意、辨識物體、或者硬體成本與酬載限制嚴格,視覺方案的資訊豐富度與成本優勢會更有吸引力。多數需要兩者兼顧的高階應用,最終還是會走向感測器融合,而不是被迫在兩者之間做出非此即彼的選擇。