Diffusion Policy vs 傳統運動規劃:機械手臂軌跡生成的新舊路線之爭

2026-09-03

規劃軌跡,還是生成軌跡——這是一個範式問題

機械手臂要完成一個抓取或放置動作,需要一條從起點到終點、避開障礙物的可行軌跡,這個問題傳統上由運動規劃(Motion Planning)演算法明確求解;但近年興起的 Diffusion Policy(擴散策略)換了一個完全不同的思路——不明確建模約束再求解,而是從大量人類示範軌跡資料中學習動作的機率分布,執行時直接從這個分布裡「生成」一條軌跡。兩種路線的哲學差異,某種程度上呼應了本站在多篇文章中討論過的規則式系統 vs 學習式系統的取捨。

傳統運動規劃:明確建模約束,求解一條可行路徑

傳統運動規劃演算法(取樣式規劃器如 RRT、或本站在逆向運動學IK 求解器比較文章中介紹的解析與數值解法)的共同特徵,是把任務明確表述成一個帶約束的最佳化或搜尋問題——起點、終點、障礙物位置都是明確已知的輸入,演算法在這些明確約束下搜尋或計算出一條滿足所有限制條件的可行軌跡。這種方法的優勢是有嚴謹的數學基礎,能對「這條軌跡不會撞到已知障礙物」這類安全屬性提供演算法層級的保證,這也是為什麼在安全要求極高的工業自動化場景,傳統運動規劃至今仍然是主流選擇。

但傳統方法的弱項在於處理「多模態」任務——當同一個場景存在好幾種同樣合理但截然不同的解決方案時(例如從左側或右側接近同一個物體都合理),依賴單一目標函數最佳化的傳統規劃演算法,往往只能收斂到其中一種解,或者在某些實作方式下,甚至可能輸出兩者之間一個實際上並不合理的折衷方案,這是傳統方法在結構上難以避免的限制。

Diffusion Policy:從示範資料的機率分布裡生成動作

Diffusion Policy 借用影像生成領域擴散模型(Diffusion Model)的核心機制——訓練時讓模型學會把一段隨機雜訊逐步「去噪」還原成訓練資料裡的真實動作序列,執行時則反過來,從隨機雜訊開始,透過學到的去噪過程逐步生成一段動作軌跡。因為這個生成過程本質上是在對訓練資料的機率分布做取樣,而不是回歸出單一確定性輸出,Diffusion Policy 天生具備保留多模態結構的能力——同一個觀測狀態下,模型有機會生成左側接近或右側接近兩種截然不同但都合理的軌跡,而不會像傳統回歸式模仿學習那樣,容易被訓練資料裡的多種示範拉扯成一個不合理的平均動作。

這種生成式建模路線也讓 Diffusion Policy 特別適合處理本站抓取偵測系列論文導讀裡討論過的精細操作任務——AnyGrasp 這類方法之所以要輸出「稠密」的抓取候選而非單一最佳解,某種程度上也是在處理同一類多模態問題(同一個物體存在多種合理抓取姿態),Diffusion Policy 則是把這種多模態建模能力,從單純的抓取姿態生成擴展到完整的動作軌跡生成層次。

落地的現實:延遲與安全保證仍是工程難題

Diffusion Policy 要真正取代傳統規劃方法用在即時控制迴路,仍然面臨兩個現實挑戰——標準擴散模型需要數十到上百步疊代去噪才能生成一個樣本,這個延遲對即時控制而言可能過高,近年的優化方向包括加速取樣演算法與一次生成整段時間範圍內的動作序列(類似模型預測控制的遞推時域概念);此外,生成式方法目前仍然缺乏傳統規劃演算法那種形式化的安全保證,實務部署通常需要額外疊加傳統碰撞檢測作為安全過濾層,而不是完全捨棄傳統方法。

兩條路線,可能走向融合而非取代

Diffusion Policy 跟傳統運動規劃目前更像是互補而非取代的關係——傳統方法在安全保證與計算效率上仍有明顯優勢,適合約束明確、解法單一的任務;生成式方法在處理多模態、需要從大量人類示範中學習複雜行為模式的任務上展現出傳統方法難以複製的彈性。可以預期的發展方向,是愈來愈多系統採用類似前面 FAQ 提到的混合架構——用生成式模型提供動作候選的多樣性,再用傳統規劃與安全驗證機制把關最終執行的軌跡,而不是單純用其中一種方法完全取代另一種。