單目、雙目、RGB-D:機器人視覺感測器該怎麼選

2026-09-02

「看到深度」這件事,有三種完全不同的做法

機器人要理解環境的三維結構,核心需求是取得深度資訊——這件事在感測器層面有三種主流做法:單目相機靠演算法從單張影像間接推算深度,雙目相機靠兩顆相機的視差直接三角測量,RGB-D 相機則用主動投射紅外線直接量測反射時間或形變。三種方案的物理原理完全不同,這也直接決定了它們在不同應用場景裡的表現差異。

單目相機:成本最低,但深度是「猜」出來的

單目相機本身只能拍到一張二維影像,沒有任何直接的深度量測機制,深度資訊必須靠演算法從單張(或連續多張)影像的間接線索推算——包括物體已知尺寸的先驗知識、影像中的透視消失線索,以及機器人或相機本身移動時同一物體在連續幀之間位置變化產生的運動視差。近年深度學習模型(單目深度估計網路)大幅提升了這種間接推算的精度,但本質上仍然是統計推論而非直接量測,精度天花板受限於訓練資料的分布與場景的相似程度,遇到訓練時沒見過的場景類型,深度估計的可靠度會明顯下降。優勢是硬體成本極低、不需要精密的多相機校正,這也是部分自駕車與消費級機器人選擇用單目視覺方案降低整體硬體成本的原因。

雙目相機:靠視差直接三角測量,但基線長度限制了有效距離

雙目立體相機模仿人類雙眼視覺原理——兩顆相機以已知的固定間距(基線,baseline)並排安裝,同一個物體在兩顆相機影像中的水平位置差異(視差,disparity)跟物體到相機的距離成反比關係,透過三角測量公式直接算出深度:

Z=fBdZ = \frac{f \cdot B}{d}

其中 ZZ 是深度、ff 是相機焦距、BB 是基線長度、dd 是視差。這個公式也直接點出雙目方案的物理限制——物體距離愈遠,視差 dd 愈小,當 dd 小到接近相機解析度能區分的極限,深度估計的精度就會快速惡化,這也是為什麼雙目相機的有效測距範圍通常侷限在幾公尺到十幾公尺內,基線愈長理論上能測得愈遠,但基線加長也代表相機模組體積變大,這是雙目方案在機構設計上的另一層取捨。

RGB-D:主動感測換取直接深度量測,代價是怕陽光

RGB-D 相機透過主動投射結構光(把已知圖案的紅外線光斑投射到場景上,依圖案形變推算深度)或飛時測距(ToF,直接量測發射光脈衝到接收反射光的時間差)取得深度資訊,不需要像雙目相機那樣依賴視覺特徵匹配,在缺乏紋理的平坦表面(白牆、單色桌面)上也能穩定取得深度,這是雙目與單目視覺方案的共同弱項——兩者都依賴影像特徵匹配或學習到的視覺線索,在缺乏紋理的表面上容易失效。但主動投射紅外線的機制,讓 RGB-D 相機在戶外強烈陽光下會明顯失效——陽光本身富含紅外線能量,會直接淹沒相機主動投射的微弱訊號,這也是為什麼 RGB-D 相機幾乎只用在室內或光線可控的場景,本站在抓取偵測方法比較一文中提到的 GG-CNN、Contact-GraspNet 等方法,多數也是以 RGB-D 相機作為主要感測輸入,正是看中室內操作場景下 RGB-D 直接量測深度的穩定性優勢。

選相機方案,本質是選一組物理限制

三種相機方案沒有絕對的優劣,只有跟應用場景物理條件是否匹配的問題——戶外自駕車需要應付強烈陽光與遠距離測距需求,RGB-D 完全不適用,多半在光達之外搭配單目或雙目視覺方案;室內機械手臂操作距離短、光線可控,RGB-D 的直接深度量測與紋理無關的穩定性就是明顯優勢;成本極度敏感、且能接受深度估計精度妥協的應用,單目視覺搭配深度學習模型是最經濟的選擇。理解這三種方案背後的物理原理限制,遠比單純比較規格表上的解析度或幀率數字,更能判斷哪一種方案真正適合特定的部署環境。