論文導讀:Contact-GraspNet——把 6 自由度抓取降維成 4 自由度來學

Martin Sundermeyer, Arsalan Mousavian, Rudolph Triebel, Dieter Fox · 2021原文連結

論文資訊卡

  • 標題:Contact-GraspNet: Efficient 6-DoF Grasp Generation in Cluttered Scenes
  • 作者:Martin Sundermeyer、Arsalan Mousavian、Rudolph Triebel、Dieter Fox(NVIDIA、DLR)
  • 發表:IEEE International Conference on Robotics and Automation (ICRA), 2021

問題背景

在雜亂場景(cluttered scene)裡對未見過的物體生成 6 自由度抓取姿態,是一個高維度的預測問題——完整的抓取姿態需要三維位置加三維旋轉共 6 個自由度描述,如果網路要直接對整個場景的每一個可能位置回歸出完整的 6 維姿態,搜尋空間非常龐大,訓練也不容易收斂。多數既有方法要嘛把問題限縮成 GG-CNN 這類只做由上往下平面抓取的簡化版本,要嘛採用取樣加評分的兩階段流程(先窮舉大量候選姿態,再逐一用網路評分),計算成本高、也不是端到端可微分的架構。

方法核心:把抓取「錨定」在點雲上

Contact-GraspNet 的核心洞察,是重新設計抓取的參數化表示法:與其讓網路直接回歸抓取夾爪中心點在三維空間裡的絕對位置,不如把這個位置限定在觀測到的點雲上——夾爪的其中一個接觸點,必須落在場景點雲的某個實際觀測到的 3D 點上。這個限制看似只是簡化,卻直接把抓取表示法的自由度從 6 維降到 4 維:接觸點的三維座標已經由點雲直接提供(不需要網路再去回歸這 3 個自由度),網路只需要額外預測夾爪繞著這個接觸點的旋轉方向(可以進一步簡化成沿夾爪接近軸的一個旋轉角)與夾爪開合寬度,就能還原出完整的 6 自由度抓取姿態。降低參數化維度直接降低了學習問題的難度,這是 Contact-GraspNet 能夠端到端訓練、且訓練資料效率明顯優於直接回歸 6 維姿態的關鍵設計決策。

整體架構是一個以點雲為輸入的端到端網路:輸入場景的深度影像轉換成點雲後,網路針對點雲上每一個點(或取樣出的一組種子點)分別預測「這個點適不適合當接觸點」的抓取品質分數,以及對應的旋轉與寬度參數,一次前向傳播就能輸出整個場景裡大量的抓取候選,不需要像取樣評分法那樣反覆疊代。

訓練與實驗結果

模型完全在模擬環境中訓練,訓練資料規模達到 1700 萬個模擬抓取樣本,是一個 class-agnostic(不限定特定物體類別)的通用抓取生成器。儘管訓練資料全部來自模擬,論文報告模型能良好泛化到真實感測器的深度資料上——這是抓取偵測研究裡常見的 sim-to-real 遷移驗證。在雜亂場景下對未見過物體的真實機械手臂抓取實驗中,Contact-GraspNet 達到超過 90% 的成功率,相對當時的先進方法把失敗率降低了約一半。

影響與定位

Contact-GraspNet 展示的核心思路——透過重新設計問題的參數化方式來降低學習難度,而不是單純堆疊更大的網路或更多訓練資料——是深度學習應用在機器人抓取領域一個值得反覆學習的設計模式。這條「把抓取錨定在觀測點雲上」的思路,後續也影響了包括 AnyGrasp 在內多個後續稠密抓取生成方法的表示法設計,AnyGrasp 論文本身也在其技術脈絡中把 Contact-GraspNet 歸類為靜態 6 自由度抓取方法的代表作之一,並在此基礎上進一步加入時序追蹤能力。

相關論文推薦

參考資料