Black Forest Labs 推出多模態模型 FLUX 3,跨界機器人操作已在 Audi 產線運行

2026-07-23

事件摘要

德國 AI 公司 Black Forest Labs 於 7 月 23 日發表新一代多模態模型 FLUX 3,這套模型用同一組權重同步在影像、影片與音訊資料上訓練,並把同一套架構延伸應用到預測機器人動作上。公司與機器人新創 Mimic 合作,結合 FLUX 3 骨幹網路與 Mimic 在精細操作與量產部署上的專長,開發出「FLUX-mimic」影片-動作模型,目前已實際運行在德國汽車廠 Audi 的產線上,執行傳統機器人難以低成本完成的軟性物體操作任務(例如處理布料、線材等非剛性材料)。根據公司揭露的數據,FLUX-mimic 只需約 30 分鐘的機器人資料就能針對特定操作任務完成微調,相較於過去同類方法動輒需要 30 小時以上的資料量大幅縮短;模型骨幹在單顆 NVIDIA RTX 5090 GPU 上,從輸入到產生世界表徵的運算時間可壓縮到 80 毫秒以內,整體系統反應時間約 101 毫秒。

技術意義解讀

Black Forest Labs 選擇把原本專注於生成影片、影像與音訊的多模態模型架構,直接延伸應用到預測機器人動作上,反映出一個逐漸成形的技術假設——影片生成模型在訓練過程中,本質上已經學會了對物理世界裡物體如何運動、如何互動的某種隱含理解,這種對物理世界動態的理解能力,跟機器人需要具備的「預測下一步動作會如何影響環境」的能力,在底層表徵上可能是高度相通的,這也是為什麼近年多個原本專注於生成式影片模型的團隊(不只 Black Forest Labs),開始嘗試把同一套模型架構跨界應用到機器人控制領域。

30 分鐘資料就能完成任務微調,相較於過去需要 30 小時以上的資料量,代表資料效率提升了兩個數量級,這個差距如果能在更廣泛的任務與場景裡被驗證,會大幅降低機器人導入新任務的邊際成本——這是本站報導過的多個機器人資料蒐集基地(如 Apptronik Robot Park)試圖解決的同一個核心問題:機器人的訓練資料取得成本遠高於純軟體 AI,任何能大幅降低單一任務所需資料量的技術突破,都可能實質改變整個產業導入新場景與新任務的速度與成本結構。

原文報導