從 RT-1 到 RT-2:機器人+大型模型的發展脈絡

Brohan et al. · 2023原文連結

論文資訊卡

問題背景

傳統機器人控制策略需要大量針對特定任務蒐集的示範資料,難以泛化到沒看過的物件或指令。RT-1 首次嘗試用 Transformer 統一處理多任務機器人資料,但仍缺乏網路規模視覺語言知識的遷移能力。

方法核心

RT-2 將視覺語言模型(VLM)直接微調為可以輸出機器人動作 token 的模型,把「動作」視為語言模型輸出的一種特殊 token 序列。這讓模型能利用網路規模的圖文資料學到的語意知識,遷移到操作沒看過的物件或理解新指令。

實驗結果摘要

RT-2 在未見過的物件與情境上,相較 RT-1 展現顯著更好的泛化能力,尤其是在需要語意推理的任務上(例如「把餓恐龍玩偶放到旁邊的水果上」需要推理隱喻)。

影響與局限

RT-2 推動了 VLA(Vision-Language-Action)模型的研究浪潮,但仍受限於推論延遲與硬體算力需求,對即時控制場景仍是挑戰。

相關論文推薦

  • RT-1:Brohan et al., 2022