RSS 2026:Ψ0 基礎模型用人類影片加少量機器人資料訓練全身操作技能

2026-07-15

事件摘要

機器人科學與系統會議(Robotics: Science and Systems, RSS)2026 於 7 月 13 日至 17 日在雪梨舉行,南加大(USC)團隊在會中發表開源基礎模型論文《Ψ0: An Open Foundation Model Towards Universal Humanoid Loco-Manipulation》,作者包括 Songlin Wei、Weiduo Yuan、Yue Wang 等人。這篇論文要解決的核心問題是:人形機器人要學會複雜的日常操作技能,直接模仿人類示範動作的效果並不理想,因為機器人的運動方式跟人類本質上不同,單純複製人類動作軌跡沒辦法有效遷移成機器人自己的控制策略。Ψ0 提出的解法是兩階段訓練框架:第一階段用超過 800 小時的人類影片學習一般化的動作模式,第二階段再用大約 30 小時的機器人專屬資料做精細微調,讓機器人能完成需要多個步驟接續完成的長時間任務。同場會議南加大團隊還發表了另外兩篇論文——用軌跡比較訓練通用機器人獎勵模型的《Robometer》,以及用對比學習做 3D 多視角動作條件操作預訓練的《CLAMP》。

技術意義解讀

Ψ0 這套兩階段訓練框架的核心價值,在於大幅降低訓練人形機器人所需要的「機器人專屬資料量」——蒐集人類示範影片的成本遠低於蒐集機器人實際操作資料(不需要真的擁有機器人硬體、不需要遠端操控、拍攝規模可以輕易擴大到網路上既有的海量影片素材),但人類影片跟機器人動作之間存在結構性差異,直接拿人類動作硬套在機器人身上通常效果不好。Ψ0 的做法是把這個遷移問題拆成兩層:先讓模型從人類影片裡學到的是相對抽象、跨形態通用的「動作模式」(例如物體大致該怎麼被接近、抓握、移動),再用少量機器人資料把這個抽象模式對應到特定機器人本體實際能執行的具體動作序列,這種先粗後細的分層學習策略,是近年具身智慧基礎模型訓練普遍採用的思路,也是這篇論文報告只需要約 30 小時機器人資料就能訓練出可用策略的關鍵原因。

值得注意的是,這篇論文與同場會議發表的 Robometer、CLAMP,共同指向具身智慧研究社群目前的一個明顯焦點轉移:從單純追求「單一任務的抓取成功率」,轉向解決訓練資料規模、獎勵訊號設計、跨視角空間推理這幾個更基礎、更影響整個訓練管線效率的結構性問題——這類基礎設施層級的研究進展,雖然不像單一機器人示範影片那樣直觀吸睛,但對整個領域的長期發展速度,往往比某一次亮眼的展示更有實質影響力。

原文報導