論文導讀:用 GG-CNN 抓取複雜形狀與細薄物體——以手術工具為例

Jaeseok Kim, Olivia Nocentini, Muhammad Zain Bashir, Filippo Cavallo · 2023原文連結

論文資訊卡

  • 標題:Grasping Complex-Shaped and Thin Objects Using a Generative Grasping Convolutional Neural Network
  • 作者:Jaeseok Kim、Olivia Nocentini、Muhammad Zain Bashir、Filippo Cavallo(義大利佛羅倫斯大學工業工程系)
  • 期刊Robotics(MDPI),2023 年第 12 卷第 41 期
  • 備註:本文是 2020 年義大利機器人與智慧機械會議(第二屆)論文的擴展版

問題背景

GG-CNNGGCNN2 這類像素級抓取生成網路,訓練與驗證大多使用 Cornell Grasp Dataset、Jacquard 這類以日常物品為主的資料集——形狀相對規則、材質也以剛性物體居多。這篇論文要處理的是完全不同難度等級的物體類別:手術工具。手術工具之所以難抓,論文歸納出三個具體原因:深度估計困難(工具本體太薄,深度相機在薄型物體上的量測誤差比例遠高於一般厚實物體)、形狀不規則(剪刀、鑷子這類工具的幾何形狀跟訓練資料集裡常見的杯子、盒子等物件差異很大)、重心難掌握(細長形狀加上金屬材質,重心位置對抓取穩定性的影響比一般物件敏感得多)。這三個困難疊加起來,讓直接套用在日常物品上訓練好的抓取模型,處理手術工具時的表現明顯不可靠。

四大貢獻

論文的貢獻可以歸納成四點:建立一個只包含複雜形狀、細薄手術工具的新資料集;提出一套結合 GG-CNN/GGCNN2 與獨立顏色分割方法的抓取架構;系統性比較四種正則化/生成式技巧套用在 GG-CNN/GGCNN2 編碼器-解碼器結構上、以 IOU 指標評估的表現;以及在真實機械手臂上進行涵蓋「已見過/未見過物體」與「非雜亂/雜亂環境」四種情境的實際抓取實驗。

系統架構

整套系統的輸入是 Kinect 拍攝的 RGB 影像,裁切成 300×300 之後分成兩條平行、互相獨立的處理路徑:一條送進 GG-CNN 或 GGCNN2,輸出抓取點的影像座標 (x,y)(x, y) 與抓取角度;另一條用 HSV 色彩空間搭配 OpenCV 做顏色分割,產生黑白遮罩後對應到深度影像,算出遮罩區域的平均深度值 zz。兩條路徑的輸出最後合併成完整的抓取姿態 (x,y,z,angle)(x, y, z, \text{angle})

這裡有個值得特別澄清的架構細節:顏色分割模組只負責計算深度值 zz,完全不參與抓取位置 (x,y)(x, y) 或角度的預測,也不是 GG-CNN 網路結構本身的一部分——這是一個平行運作、跟抓取姿態預測完全解耦的獨立模組,存在的唯一理由是彌補薄型物體深度感測不準確的問題。這個設計本身邏輯清楚:讓 GG-CNN 系列繼續專注做它原本擅長的抓取姿態預測,深度估計這個對薄型物體特別棘手的子問題,交給另一個更適合的方法獨立處理。

抓取表示法

論文延續 Morrison et al.(也就是 GG-CNN 原始論文)提出的抓取表示:一組抓取 g={p,φ,w,q}g = \{p, \varphi, w, q\}p=(x,y,z)p = (x, y, z) 是夾爪中心位置、φ\varphi 是相對影像平面水平軸的旋轉角、ww 是夾爪寬度、qq 是抓取品質(成功機率)。網路輸出的抓取圖(Grasp Map)G={Φ,W,Q}R3×H×WG = \{\Phi, W, Q\} \in \mathbb{R}^{3 \times H \times W},對每個像素都給出對應的角度、寬度與品質預測,跟 GG-CNN 原始論文的輸出定義完全一致。

資料集

研究團隊拍攝了 320 張手術工具 RGB 原始影像,透過隨機旋轉、縮放、抖動、加入白雜訊、調整亮度等資料增強手法,擴增到 9920 張。訓練與測試切分(針對 GGCNN2)採 80/20 比例,但有一個刻意的設計:訓練集與驗證集使用不同的工具類別,目的是測試模型對「訓練時完全沒見過的物體形狀」的泛化能力,而不只是在同類物體上做插值。標註方式是人工標註抓取矩形的四個頂點座標,存成文字檔,格式與 Cornell Dataset 的標註慣例一致。這個資料集(SurgicalKit)已經公開在 GitHub 上。

四種編碼器-解碼器變體

論文把四種正則化/生成式技巧分別套用在 GG-CNN 與 GGCNN2 的編碼器-解碼器結構上,比較各自對抓取預測品質的影響:

Contractive Network(收縮網路)在損失函數裡加入一個「收縮懲罰項」——每一層隱藏輸出對前一層輸入的雅可比矩陣 Frobenius 範數,目的是讓模型對輸入的微小擾動不敏感,在訓練資料點附近達到局部平坦性。這個技巧的公式引用自 Gu 與 Rigazio 2014 年的論文《Towards Deep Neural Network Architectures Robust to Adversarial Examples》——值得注意的是,這篇原始論文的研究目標是防禦對抗樣本攻擊,跟「處理一般環境雜訊或小樣本泛化」是完全不同的問題設定,手術工具論文借用了這個技巧的損失函數公式,但沒有進一步論證或驗證這個從「對抗防禦」遷移到「小樣本抓取泛化」任務的合理性。

**Denoising Network(去噪網路)**在訓練前對輸入資料加入隨機雜訊,讓模型從被破壞的輸入學會還原正確標籤,藉此得到更穩健的內部表示。**Sparse Network(稀疏網路)**限制網路的連結結構與神經元活躍程度,讓每個神經元只接收有限數量神經元的輸入,任一時刻僅少數神經元處於活躍狀態。**VAE Network(變分自編碼器)**把編碼器輸出改成潛在分布參數(平均值與共變異數),解碼器依此分布重建輸出,因為結構跟原始 VAE 不同,訓練時用了三種 MSE 損失函數的組合。

實驗結果一:IOU 比較

模型IOU(滿分 1)
GG-CNN0.79
GG-CNN20.88
Contractive-GG-CNN0.78
Contractive-GG-CNN20.98(最高)
Denoising-GG-CNN0.41(明顯異常低)
Denoising-GG-CNN20.90
Sparse-GG-CNN0.73
Sparse-GG-CNN20.96
VAE-GG-CNN0.18
VAE-GG-CNN20.26(最低)

論文對這組結果的解釋是:Contractive 表現好是因為帶懲罰項的損失函數屬於正則化技術、有助於萃取有用特徵,但這個說法只有一句話帶過,沒有消融實驗佐證;VAE 表現最差則歸因於潛在分布壓縮過程遺失了新資料集的許多特徵,加上原始 VAE 結構本身未針對這個任務最佳化。Denoising 與 Sparse 兩組結果之間的巨大落差,論文並未提供具體原因說明。

這組數據裡有兩個論文沒有討論、但讀者應該注意的矛盾點:第一,Contractive-GG-CNN(0.78)其實略低於原始 GG-CNN(0.79),並沒有變好;第二,同一個 Contractive 技巧搭配 GGCNN2 帶來 +0.10 的明顯提升,搭配 GG-CNN 卻幾乎沒有效果甚至略降。這代表「加上 Contractive 確實提高效果」這個論文敘述並不是普遍成立的結論,只能說「在搭配 GGCNN2 時有明顯提升」,論文沒有解釋這種依賴特定 backbone 才成立的落差從何而來。Denoising-GG-CNN(0.41)與 Denoising-GGCNN2(0.90)之間同樣巨大的落差,也沒有被進一步解釋。

實驗結果二:真實機械手臂抓取成功率

網路深度方式已見過工具成功率未見過工具成功率
GG-CNN固定深度62%73.64%
GG-CNN2固定深度94.8%78.18%
GG-CNN分割法74%66.36%
GG-CNN2分割法85.6%90%(最高)

分割法搭配 GGCNN2 抓取未見過的工具時效果最佳;GGCNN2 整體優於 GG-CNN,論文將此歸因於 GGCNN2 的擴張卷積層在語意分割相關任務上表現較佳。一個有趣但反直覺的現象是:已見過的工具成功率有時反而低於未見過的工具,論文將這個現象解釋為「已見過的工具形狀較複雜」所致,但沒有進一步的定量分析支持這個歸因。

與其他資料集的橫向比較

模型手術工具(僅未見過類別)Cornell日常用品Jacquard餐廳物品
GG-CNN66.36%85.39%–91%91.45%94.14%
GGCNN290%95.5%94%

這組對照清楚呈現手術工具作為抓取目標的難度:即使是表現最好的 GGCNN2 + 分割法組合,在手術工具上的成功率(90%)仍略低於它在 Jacquard 或餐廳物品資料集上的表現(94–95.5%),驗證了論文一開始提出的假設——形狀複雜、細薄的物體確實比一般日常物品更難抓取。

多物體雜亂環境實驗

團隊另外用 9 個未見過的工具、搭配 5 種不同擺放配置,總共進行 45 次抓取嘗試,測試模型在多工具雜亂堆疊環境下的表現。結果是:只有「GG-CNN + 固定深度」這個組合取得相對較好的結果(68.89% 成功率),其餘組合(包括表現在單物體測試裡更好的 GGCNN2、分割法)在雜亂環境下反而表現較差——這代表單物體測試裡表現最佳的組合,不必然是雜亂環境下最穩健的選擇,模型在乾淨背景與雜亂堆疊場景下的排名並不一致。

失敗案例分析

單一工具抓取常見的失敗模式包括:工具抓取後掉落(原因包括物體過長、重心未被準確估計、重量與材質因素);形狀特殊的物體難以穩定抓取,且細長物體比粗短物體更難握持;GGCNN2 在訓練樣本不足時,無法從顏色跟訓練資料明顯不同的工具上正確找出抓取框;顏色分割結果錯誤(同樣源自訓練樣本不足);以及 MoveIt! 軟體偶發性錯誤(通常重新執行即可解決,屬於系統穩定性問題而非演算法問題)。多工具雜亂環境下另外常見抓取框定位不準確、材質或重量導致抓取後掉落、以及分割輸出的深度平均值計算不準確等問題。

論文自陳的限制與改進方向

論文承認訓練資料集在光照條件與環境因素的變化範圍仍然有限,難以完全適應全新物體;對於幾何形狀複雜或遭到部分遮擋的物體,因為系統依賴相對簡單的幾何抓取位置判斷,表現並不理想。作者提出的改進方向包括擴充訓練資料集涵蓋更多樣的形狀、材質與尺寸,探索遷移學習與領域適應方法,以及加入觸覺等額外感測器資訊來補強視覺系統的不足。

整體評析

《Robotics》(MDPI)在 Scopus/ESCI 分類裡屬於 Control and Optimization 類別 Q1、Robotics 類別 Q2 的中等偏上等級期刊,並非 IJRR、IEEE T-RO 這類頂尖期刊。論文的架構設計本身邏輯清楚:GG-CNN 系列負責抓取姿態預測、顏色分割負責深度估計,兩者平行獨立運作,分工合理、也切合手術工具「薄到深度感測不準」這個具體痛點。

但論文的論證強度存在幾個明顯薄弱之處,值得讀者在引用結論時保持謹慎:Contractive 技巧的理論依據直接挪用自為對抗樣本防禦設計的方法,論文沒有論證這個遷移到小樣本抓取泛化任務上為何成立;表 2 裡「Contractive 整體表現較好」的敘述跟實際數據(Contractive-GG-CNN 其實沒有提升)之間存在沒有被討論的落差;Denoising 與 Sparse 兩種技巧在搭配不同 backbone 時的表現差異,論文同樣缺乏具體的機制分析;整體而言,論文在解釋「為什麼某個技巧有效」時,普遍缺少消融實驗或特徵可視化這類能支持因果推論的實證手段,多數解釋停留在事後合理化的層次。這不代表論文的工程貢獻沒有價值——資料集本身公開、系統架構的分工邏輯也確實可取——但讀者引用其中「某技巧優於另一技巧」的具體結論時,應該意識到這些結論目前主要建立在單一資料集、單一 backbone 組合上的觀察,尚未有充分的理論或消融實驗支撐其普遍性。

相關論文推薦

參考資料

  • 資料集 GitHub:SurgicalKit
  • Contractive 理論原始出處:Gu, S.; Rigazio, L. (2014). Towards Deep Neural Network Architectures Robust to Adversarial Examples. arXiv:1412.5068