論文導讀:Octo——用 800K 條跨機器人形態軌跡訓練的開源通用策略

Octo Model Team (UC Berkeley, Stanford, CMU, Google DeepMind et al.) · 2024原文連結

論文資訊卡

  • 標題:Octo: An Open-Source Generalist Robot Policy
  • 作者:Octo Model Team(UC Berkeley、Stanford、CMU、Google DeepMind 等多機構合作)
  • 發表:Robotics: Science and Systems (RSS), 2024

問題背景

即使有了 OpenVLA 這類開源的大型 VLA 模型,機器人研究社群仍然面對一個實際問題:不同實驗室、不同公司使用的機器人硬體差異極大——感測器配置不同(有的只有單一 RGB 相機,有的有多視角相機加上力覺感測器)、動作空間不同(不同機械手臂的自由度數與控制介面各異)。一個通用基礎模型如果沒辦法有效率地適配到這些形形色色的硬體設定上,實用價值會大打折扣。Octo 要解決的核心問題,就是打造一個對硬體差異夠寬容、微調成本夠低的通用機器人策略。

方法核心

Octo 是一個以 Transformer 為核心的策略模型,訓練資料來自 Open X-Embodiment 資料集裡規模達 80 萬條軌跡的子集,同樣涵蓋多種機器人形態。模型設計上刻意保持對輸入輸出介面的彈性:任務指令可以用自然語言描述,也可以用一張目標影像(goal image,直接展示希望場景變成什麼樣子)來下達,兩種模式都在同一個模型裡支援;輸入的感測器配置與輸出的動作空間,則透過模組化的「讀取頭」(readout head)設計,讓使用者能針對自己的機器人平台,在不需要改動模型核心架構的前提下,接上新的感測器輸入或動作輸出介面。

這個模組化設計直接服務於論文最強調的實用目標:微調效率。使用者要把 Octo 適配到一個全新的機器人設定(例如新增了一個從沒在訓練資料裡出現過的感測器、或是完全不同自由度數的機械手臂),論文報告只需要在標準的消費級 GPU 上、幾個小時內完成微調,而不需要動用大型機構才負擔得起的算力規模去重新訓練整個模型。

實驗結果

Octo 在 9 種不同的真實機器人平台上做了驗證,展示了作為「策略初始化」(policy initialization)的通用性——不管下游機器人平台的感測器組合或動作空間跟訓練資料集裡的原始形態差異多大,Octo 都能有效地被微調適配上去,這個跨硬體形態的適配廣度,是論文相對之前同類研究工作最主要的實務貢獻。

影響與定位

Octo 與 OpenVLA 幾乎同期發表,兩者都建立在 Open X-Embodiment 這個跨機構彙整的資料集之上,共同代表了 2024 年機器人基礎模型研究的一個重要轉折點——研究社群開始有能力訓練出不受限於單一機器人硬體、能快速遷移到新平台的通用策略,而且訓練與微調的門檻已經降低到學術實驗室與中小型團隊也能負擔的程度。Octo 相對 OpenVLA 更強調的是硬體介面的彈性與微調的輕量化,兩者某種程度上代表了 VLA 研究裡「追求更大規模、更強語意理解能力」(OpenVLA 路線)與「追求更廣泛硬體相容性、更低微調成本」(Octo 路線)兩個並行但互補的優化方向。

相關論文推薦

參考資料