Generalist AI 發表 GEN-1:同一套基礎模型能學會操作各種不同機器人手

2026-07-24

事件摘要

由前 Google DeepMind 研究員創立、獲 NVIDIA NVentures 投資的機器人新創 Generalist AI,發表最新一代具身基礎模型 GEN-1,據公司公布的數據,任務成功率達 99%、執行速度較前代提升三倍。GEN-1 最大的更新是支援大幅擴展的末端執行器種類——從五指仿人形機械手,到各種採用不同致動方式的特化工具都能相容,公司為此設計了新硬體,並把數千支機器人手部裝置運送到不同地區蒐集多樣化的實體操作經驗。公司表示 GEN-1 是資料效率極高的學習系統:在部分測試裡,只需要前一代模型十分之一的任務專屬資料與微調步驟,就能達到相近的表現,且展示結果多半只用了約一小時的機器人資料建置而成。

技術意義解讀

GEN-1 支援多樣化末端執行器這個特性,直接指向具身智慧基礎模型領域一個核心的技術目標:跨形態遷移(cross-embodiment transfer)——理想情況下,一套基礎模型應該能學到跟特定機器人硬體無關、相對抽象的「操作物理世界」的通用知識,再快速適配到各種不同的機器人本體與末端執行器上,而不需要針對每一種硬體形態都從頭訓練一套獨立模型。這對機器人產業的實務意義很直接:不同廠商、不同應用場景使用的夾爪與靈巧手設計差異極大,如果每一種硬體都需要獨立的大規模訓練,具身智慧基礎模型的開發與部署成本會呈倍數成長,跨形態遷移能力越強,同一套核心模型能覆蓋的商用場景就越廣。

值得特別注意的是論文提到「預訓練資料集完全不包含機器人資料」這個細節——代表 GEN-1 的預訓練階段學到的是從其他來源(很可能是大規模的人類影片或其他形式的視覺與動作資料)萃取出的通用知識,模型是在真正接觸到特定任務與特定機器人形態的那一刻,才同時完成「適應這個機器人本體」與「學會這個任務」兩件事,而不是分成兩個獨立階段依序完成。這種訓練方式如果真的能維持報告中一小時級別的資料效率,代表企業導入新的機器人硬體或新任務時,需要的客製化訓練成本可以壓縮到遠低於傳統從頭訓練的規模,這是具身智慧基礎模型要真正大規模商用化必須跨過的門檻之一。

原文報導