小米開源 380 億參數機器人世界模型 Robotics-U0,合成資料生成加速 82 倍

2026-07-15

事件摘要

小米於 7 月 15 日開源 Xiaomi-Robotics-U0,一個 380 億參數的多模態自迴歸世界基礎模型,同時整合文字轉圖像生成、圖像編輯、具身場景生成、具身遷移與具身影片生成四項任務於單一架構。模型的核心賣點是透過「對角平行解碼」(diagonal parallel decoding)與快取排程技術,把生成一張 1024×1024 高解析度訓練影像的時間從 450.77 秒壓縮到 5.44 秒,效率提升約 82.9 倍,稱為 FlashAR+ 加速技術。小米表示,用這套系統生成的合成資料訓練出的獨立機器人抓取策略,在真實世界測試中的成功率提升了 26 個百分點。

技術意義解讀

訓練機器人視覺策略最大的成本瓶頸之一,一直是取得大量、多樣化、跟真實世界統計特性夠接近的標註訓練資料,真實世界資料蒐集不僅昂貴、還受限於實體機器人與人力的可用時間。Xiaomi-Robotics-U0 這類世界模型的價值在於:把這個瓶頸從「實體資料蒐集速度」轉移成「生成模型的運算速度」,而 82 倍的生成加速,代表同樣的運算預算能產生遠多於過去的訓練資料量,這對下游策略的泛化能力有直接幫助。

值得對照理解的是,這條「用生成模型合成訓練資料」的路線,跟直接用真實標註資料集訓練一個輕量、任務單一的像素級抓取生成網路,是完全不同的技術路徑——前者先訓練一個通用的世界模型來大量生成合成訓練資料,再用這些資料訓練下游的任務策略,優勢是能大幅降低真實資料蒐集成本、擴展到更多樣化的任務與場景,但也依賴合成資料與真實世界的分布落差要夠小,這正是域隨機化(domain randomization)技術在整條訓練管線裡持續扮演關鍵角色的原因。

原文報導