論文導讀:OpenVLA——70 億參數的開源 VLA,用七分之一參數打敗 RT-2-X
Moo Jin Kim, Karl Pertsch, Siddharth Karamcheti, et al. · 2024原文連結
論文資訊卡
- 標題:OpenVLA: An Open-Source Vision-Language-Action Model
- 作者:Moo Jin Kim、Karl Pertsch、Siddharth Karamcheti 等(Stanford、UC Berkeley、Toyota Research Institute、Google DeepMind 等機構合作)
- 發表:Conference on Robot Learning (CoRL), 2024
問題背景
RT-2 證明了把視覺語言模型(VLM)直接微調成輸出機器人動作 token 的做法,能有效把網路規模的語意知識遷移到機器人操作任務上,但 RT-2 是 Google 內部訓練、參數規模達 550 億的閉源模型,外部研究者與團隊沒辦法直接取用、檢視或在自己的機器人硬體上微調。這讓 VLA(Vision-Language-Action)這條研究路線雖然證明可行,卻缺乏一個開放、可重現、社群能共同迭代的基礎模型,這正是 OpenVLA 要填補的空白。
方法核心
OpenVLA 的骨幹是 Llama 2 語言模型,搭配一個融合視覺編碼器——把 DINOv2(擅長捕捉細粒度空間特徵)與 SigLIP(擅長語意層級的圖文對齊)兩個預訓練視覺模型的特徵融合起來,合計約 6 億參數,作為模型理解影像輸入的視覺骨幹。整個模型參數量約 70 億,訓練資料來自 Open X-Embodiment 這個彙整了多個機構、多種機器人形態示範資料的大型資料集,涵蓋約 97 萬條軌跡,讓模型從一開始就在跨機器人形態的資料上訓練,而不是只針對單一機器人平台。跟 RT-2 一樣,動作輸出被表示成語言模型詞彙表裡的離散 token,讓機器人控制問題能直接套用語言模型既有的訓練與推論框架,差別在於 OpenVLA 完整公開模型權重、訓練程式碼與資料處理流程。
實驗結果
論文報告 OpenVLA 在跨機器人形態的通用操作能力上表現強勁——在涵蓋 29 項任務、多種機器人形態的評測中,OpenVLA 以七分之一的參數量(70 億 vs 550 億),在絕對任務成功率上超越了封閉模型 RT-2-X 約 16.5 個百分點。這個結果的意義不只是「數字更好」,更重要的是證明了開源、可完整取用的模型架構,只要訓練資料與訓練方法設計得當,不一定需要堆疊到閉源模型的參數規模,就能達到甚至超越的效能水準。論文也展示了 OpenVLA 能透過參數高效微調(parameter-efficient fine-tuning)的方式快速適配到新的機器人硬體設定上,不需要重新訓練整個模型。
影響與定位
OpenVLA 的完整開源(模型權重、訓練程式碼、資料處理流程全部公開)大幅降低了機器人基礎模型研究的進入門檻——在 OpenVLA 之前,能訓練與研究這類規模 VLA 模型的幾乎只有少數擁有龐大算力與內部資料的大型機構;OpenVLA 釋出後,學術實驗室與新創公司都能在這個基礎上直接微調、二次開發,這也是為什麼 OpenVLA 至今仍是機器人 VLA 研究領域被引用與二次開發最頻繁的基礎模型之一,某種程度上扮演了跟 Llama 系列在通用語言模型領域類似的角色——不是效能天花板最高的模型,而是讓整個研究社群能站在同一個開放起點上持續迭代的基礎設施。
相關論文推薦
參考資料
- 原始碼與模型權重:openvla/openvla