從 RT-1 到 RT-2:機器人+大型模型的發展脈絡
Brohan et al. · 2023原文連結
論文資訊卡
- 作者:Anthony Brohan et al.(Google DeepMind)
- 年份:2023
- 原文連結:RT-2: Vision-Language-Action Models
問題背景
傳統機器人控制策略需要大量針對特定任務蒐集的示範資料,難以泛化到沒看過的物件或指令。RT-1 首次嘗試用 Transformer 統一處理多任務機器人資料,但仍缺乏網路規模視覺語言知識的遷移能力。
方法核心
RT-2 將視覺語言模型(VLM)直接微調為可以輸出機器人動作 token 的模型,把「動作」視為語言模型輸出的一種特殊 token 序列。這讓模型能利用網路規模的圖文資料學到的語意知識,遷移到操作沒看過的物件或理解新指令。
實驗結果摘要
RT-2 在未見過的物件與情境上,相較 RT-1 展現顯著更好的泛化能力,尤其是在需要語意推理的任務上(例如「把餓恐龍玩偶放到旁邊的水果上」需要推理隱喻)。
影響與局限
RT-2 推動了 VLA(Vision-Language-Action)模型的研究浪潮,但仍受限於推論延遲與硬體算力需求,對即時控制場景仍是挑戰。
相關論文推薦
- RT-1:Brohan et al., 2022