大型模型與 VLA
機器人與大型模型交會的最新研究。
論文導讀:Octo——用 800K 條跨機器人形態軌跡訓練的開源通用策略
拆解 Octo 這個以 Transformer 為骨幹的通用機器人策略,如何用語言指令或目標影像兩種方式下達任務,並設計成能在消費級 GPU 上、幾小時內微調適配到全新感測器與動作空間的機器人平台。
閱讀導讀論文導讀:OpenVLA——70 億參數的開源 VLA,用七分之一參數打敗 RT-2-X
拆解 OpenVLA 如何用 DINOv2 與 SigLIP 融合視覺編碼器搭配 Llama 2 語言骨幹,在 97 萬條跨機器人形態軌跡上訓練,以七分之一的參數量在 29 項任務上超越封閉的 RT-2-X。
閱讀導讀從 RT-1 到 RT-2:機器人+大型模型的發展脈絡
RT-2 將視覺語言模型與機器人動作輸出結合,是 VLA 模型的重要里程碑。
閱讀導讀論文導讀:SAFE——從 VLA 模型的隱藏狀態裡,直接讀出「這次任務要失敗了」
拆解 SAFE 如何從 OpenVLA、π0、π0-FAST 等 VLA 模型最後一層 transformer block 的 hidden state 裡抽取特徵,訓練一個跨任務通用的失敗偵測器,並精確定位這個抽取點在 Decoder 架構圖裡究竟對應哪一個張量。
閱讀導讀