FLUX 3 發布:多模態流模型用於視覺智能

FLUX 3 發布:多模態流模型用於視覺智能

FLUX 3 是一個多模態基礎模型,旨在超越孤立的模態學習。透過對圖像、視頻和音頻進行聯合訓練,該模型發展出對物理現實的統一表示——捕捉空間結構、時間動態和聲學因果關係——以便在不同媒體類型上實現更準確的預測和生成。

統一多模態架構

FLUX 3 建立在 Self-Flow 方法之上,該方法在單一架構內對齊多模態生成與理解。與傳統的流匹配(FM)不同,Self-Flow 使模型能夠更有效地對齊這些模態。根據 Black Forest Labs 的說法,此架構使模型能夠理解「聲音必須與衝擊匹配,運動必須服從質量,[而且] 未來必須從過去延伸。」

主要能力

視頻和音頻生成

FLUX 3 能夠生成帶有原生音訊、長度可達 20 秒的高多樣性視頻。其能力包括:

  • Text-to-Video: 從純文本提示創建剪輯。
  • Image-to-Video: 動畫化起始幀或使用圖像作為視覺參考。
  • Video-to-Video: 將來源視頻的核心元素(如角色)帶入新情境。
  • Generative Continuation: 擴展現有的視頻和音頻序列。
  • Keyframe-to-Video: 在定義的時刻之間創建受控過渡。
  • Multilingual Dialogue: 生成多種語言的口語對話。
  • Agentic Chaining: 將單個剪輯鏈接成更長的多鏡頭序列。

圖像合成與編輯

FLUX 3 Image 透過增強處理複雜提示和在多種語言中高精度文字渲染的能力,優於之前的 FLUX 版本,適用於各種風格和解析度。

動作預測與實體 AI

該模型對世界的理解透過兩種方法應用於動作預測:將動作預測原生整合到 FLUX 3 骨幹中,以及使用預訓練的視頻骨幹作為專門動作模型的基礎。與 mimic robotics 的合作產生了 FLUX-mimic,這是一個專門用於生產環境中靈巧操作的視頻-動作模型,目前正在 Audi 進行測試。

效能評估

初步評估顯示,FLUX 3 Video 在頭對頭比較中優於幾個競爭模型。偏好率如下:

Model Preference Rate
Luma Ray 3.2 93%
Runway Gen-4.5 77%
Grok Imagine Video 69%
Kling v3 Pro 60%
Happy Horse v1 59%
Happy Horse 1.1 57%
Seedance 2.0 52%
Gemini Omni Flash 52%

推出計畫與存取

Black Forest Labs 將透過早期存取階段推出以下功能:

  • FLUX 3 Video: 透過 API 和私有權重存取進行視頻和音頻生成/編輯。
  • FLUX 3 Action: 透過研究和商業合作夥伴(例如 mimic robotics)進行動作預測。
  • FLUX 3 Image: 透過 API 和私有權重存取進行圖像合成與編輯。
  • FLUX 3 Dev: 多模態骨幹的開放權重存取,用於內容創建和動作預測。

社區觀點

儘管官方公告強調了世界模型能力,但 Hacker News 上的社區反應褒參不一。一些使用者對即將推出的開放權重「Dev」版本感到興奮,而另一些使用者則對公告中使用的術語持懷疑態度。

"I hope the open-weight versions will be SOTA. ... I really hope Flux 3 has a comparable updated open-weights model to it."\n 批評者指出初次展示中缺乏人類範例,並質疑「World Model」一詞的使用,認為公告的語言感覺像是「LLM slop 寫作」。

"Showed close to zero examples of people. - Frivolous use of the term World Model. - Claims 20 seconds of video, shows only jumpcuts."\n 其他使用者指出該模型有潛力成為歐洲 AI 發展的重要一步,正如一位使用者所言:「來自歐洲的首個 AI 產品,讓人抱有高度期望。」

Sources