Yaskawa 與 SoftBank 展示 VLA 系統辨識並抓取不規則排列物件
2026-07-13
事件摘要
工業機器人大廠 Yaskawa 與 SoftBank 在 7 月 13 日的聯合展示中,讓 Yaskawa 的 MOTOMAN NEXT 機械手臂搭配 SoftBank 開發的視覺語言動作(VLA)系統,成功辨識並抓取擺放方式不規則的線束(wire harness),將它們放入指定的箱子裡。這類「形狀、擺放方式不固定」的物件,過去一直是傳統抓取規劃流程裡最難處理的情境之一。
技術意義解讀
這則展示是本站第 7 章 MoveIt2 機械手臂與 VLA 模型結合的具體案例。傳統的機械手臂抓取流程,通常需要工程師針對特定物件手動設計:先用電腦視覺辨識物件與姿態,再套用預先寫好的抓取策略,遇到新物件往往要重新調整參數——這種做法在物件種類固定的產線上效率很高,但線束這類每次擺放角度、彎折方式都不同的軟性物件,很難用固定規則窮舉處理。
VLA 系統的做法是讓模型直接從影像學習「看到什麼樣的物件、該用什麼方式抓取」,這跟本站抓取與夾爪控制介紹的接近、抓取、撤離三階段流程並不衝突——實務上更可能的整合方式,是讓 VLA 模型負責「辨識抓取點與姿態」這個決策環節,輸出結果再交給 MoveIt2 的規劃器完成碰撞檢查、找出實際可行的運動軌跡,兩者分工互補,而不是互相取代。這與本站介紹過的 GG-CNN 這類專門做像素級抓取生成的模型,是同一個技術脈絡上的不同世代方案——差別在於 VLA 額外加入了語言理解能力,能處理更複雜、需要脈絡判斷的指令,而不只是單純輸出抓取品質地圖。