FLUX 3 和 FLUX-mimic:將視訊-動作模型整合至實體 AI

FLUX 3 和 FLUX-mimic:將視訊-動作模型整合至實體 AI

FLUX-mimic 利用視訊生成來驅動實體機器人

FLUX-mimic 是由 Black Forest Labs (BFL) 與 mimic robotics 合作開發的下一代視訊-動作模型。它將 FLUX 3 多模態基礎模型作為骨幹,將視覺智慧轉化為物理動作,使機器人能夠在真實世界的生產環境中執行複雜的操作任務,例如奧迪的生產線。

FLUX-mimic 的核心論點是,能夠生成真實視訊的模型必然內在地學習一個「世界模型」——即接觸、運動、重量和因果關係的內部表示。透過從這個學得的表示中解碼動作,FLUX-mimic 將內容創作工具轉變為實體 AI 系統。

FLUX 3 多模態骨幹

FLUX 3 是一個單一模型,同時在圖像、視訊和音訊上進行聯合訓練。根據 BFL 的說法,視訊預測是訓練中計算需求最高的部分,佔總計算成本的 95% 以上。這種強度是必要的,因為真實的視訊生成要求模型能夠準確模擬物理世界的行為。

動作預測的整合

BFL 發現,在 FLUX 3 課程中加入動作預測不會永久降低其生成能力。在大規模訓練期間,人類對 text-to-video 和 image-to-video 的評分最初最多下降 10%,但模型在 3,500 步後恢復了完整品質。這表明視訊生成和動作預測可以共享單一骨幹,而不會爭奪容量。

用於表示學習的 Self-Flow

為了讓世界模型可用於機器人,BFL 使用了一個名為 Self-Flow 的框架。儘管標準生成模型常產生「糾纏」的表示,限制其在下游任務中的實用性,Self-Flow 統一了生成與表示學習。這帶來互惠的改善:各模態的生成品質提升,且模擬中機器人控制任務的成功率提高。

從世界模型到工廠部署

FLUX-mimic 將 FLUX 3 骨幹應用於通用操作任務。它採用一個輕量級動作解碼器,該解碼器是在從 FLUX 骨幹的視訊預測路徑提取的中間特徵上進行訓練的。

在奧迪的真實世界應用

FLUX-mimic 已部署在奧迪的生產和物流作業中,展示了處理傳統自動化 previously 無法完成的任務的能力,包括:

  • 將零件套件放入結構化托盤。
  • 將電子控制單元插入緊密配合的固定具。
  • 組裝元件。
  • 處理軟質柔性材料,例如密封件和電纜。

樣本效率與穩健性

由於世界的物理特性已經嵌入在 FLUX 3 的表示中,模型不需要為每個新任務重新教授世界如何運作。這帶來了顯著的效率提升:

  • 減少資料需求: 在 Self-Flow 實驗中,動作預測達到目標成功率所需的訓練步數僅為未使用 Self-Flow 模型的一半。
  • 提高樣本效率: mimic-video 研究報告指出,視訊-動作模型相比視訊-語言-動作 (VLA) 模型的樣本效率最高可達 10 倍。
  • 自主恢復: 模型能在未被明確展示該特定失敗案例的示範集中,自行從失敗中恢復(例如修正錯誤的抓取),而依賴其內部世界模型。

效能與延遲限制

為了在工廠地板上可行,模型必須以與人類視覺反應時間相当的反應時間運行。

硬體優化

透過使用結構良好的世界模型,BFL 可以使用更小的骨幹來達成高效能,從而降低延遲。FLUX-mimic 骨幹在單顆 NVIDIA RTX 5090 GPU 上將輸入處理為世界表示的時間少於 80 毫秒。

系統範圍延遲

透過 mimic 的部署堆疊——其中包括優化動作解碼器以及減少感測器與執行器之間的程間延遲——總系統反應時間為 101 毫秒。

社群見解

業界觀察者和開發者指出了此方法的含義,具體來說,就是能夠從生成式視訊模型中推導出世界模型。

"一個訓練有素的多模態視訊生成模型內部擁有一個已訓練好的世界表示模型。他們已完成一些工作,將這個世界模型提取出來並部署到機器人上……訓練視訊模型、販售視訊生成、擴大規模、利用規模來訓練機器人相關事物:獲利。"

其他觀察者強調了模型自主解決錯誤的能力,指出機器人嘗試多次重新安裝元件的能力是機器人解決能力的一項重要進展。

摘要: Black Forest Labs 和 mimic robotics 已推出 FLUX-mimic,這是一個建基於 FLUX 3 多模態骨幹的視訊-動作模型,透過從視訊生成能力中解碼世界知識,使機器人能夠執行複雜的操作任務。

標題: FLUX 3 和 FLUX-mimic:將視訊-動作模型整合至實體 AI

Sources