FLUX 3 リリース: 視覚インテリジェンスのためのマルチモーダルフローモデル
FLUX 3 リリース: 視覚インテリジェンスのためのマルチモーダルフローモデル
FLUX 3 は、孤立したモダリティ学習を超えるように設計されたマルチモーダルファンデーションモデルです。画像、ビデオ、オーディオに共同でトレーニングすることで、空間構造、時間的ダイナミクス、音響的因果関係を捉える物理現実の統一表現を開発し、さまざまなメディアタイプ間でより正確な予測と生成を可能にします。
統合マルチモーダルアーキテクチャ
FLUX 3 は、Self-Flow アプローチに基づいて構築されており、単一のアーキテクチャ内でマルチモーダルな生成と理解を整合させます。従来のフローマッチング (FM) とは異なり、Self-Flow はこれらのモダリティをより効率的に整合させることを可能にします。Black Forest Labs の説明によると、このアーキテクチャによりモデルは "音は衝撃に合致し、運動は質量に従い、[そして] 未来は過去から続く" ことを理解できるようになります。
主な機能
ビデオとオーディオの生成
FLUX 3 は、ネイティブオーディオを伴う最大 20 秒の高多様性ビデオを生成できます。その機能には以下が含まれます:
- テキストからビデオ: 純粋なテキストプロンプトからクリップを作成。
- 画像からビデオ: 開始フレームをアニメーション化するか、画像を視覚的参照として使用。
- ビデオからビデオ: ソースビデオからの中心的な要素(キャラクターなど)を新しい文脈に持ち込む。
- ジェネレーティブ継続: 既存のビデオおよびオーディオシーケンスを拡張。
- キーフレームからビデオ: 定義された瞬間間の制御された遷移を作成。
- 多言語対話: 複数の言語で話された対話を生成。
- エージェンティックチェーン: 個々のクリップを長いマルチショットシーケンスにリンク。
画像合成と編集
FLUX 3 Image は、複雑なプロンプトを処理し、さまざまなスタイルと解像度で複数言語における高精度テキストレンダリング能力を向上させることにより、以前の FLUX バージョンを改善します。
アクション予測と物理 AI
モデルの世界理解は、2 つの方法でアクション予測に適用されます:FLUX 3 バックボーンへのアクション予測のネイティブ統合、および事前トレーニングされたビデオバックボーンを専門的アクションモデルの基盤として使用することです。mimic robotics とのパートナーシップにより、FLUX-mimic が生まれました。これは製造環境での器用な操作に特化したビデオアクションモデルで、現在 Audi でテストされています。
パフォーマンス評価
予備的な評価によると、FLUX 3 Video はヘッド・トゥ・ヘッドの比較でいくつかの競合モデルよりも好まれています。好みの率は以下の通りです:
| モデル | 好みの率 |
|---|---|
| Luma Ray 3.2 | 93% |
| Runway Gen-4.5 | 77% |
| Grok Imagine Video | 69% |
| Kling v3 Pro | 60% |
| Happy Horse v1 | 59% |
| Happy Horse 1.1 | 57% |
| Seedance 2.0 | 52% |
| Gemini Omni Flash | 52% |
ローンチプランとアクセス
Black Forest Labs は、早期アクセスフェーズを通じて以下の機能を展開します:
- FLUX 3 Video: API とプライベートウェイトアクセスを介したビデオおよびオーディオの生成/編集。
- FLUX 3 Action: 研究および商業パートナー(例:mimic robotics)を通じたアクション予測。
- FLUX 3 Image: API とプライベートウェイトアクセスを介した画像合成および編集。
- FLUX 3 Dev: コンテンツ作成とアクション予測のためのマルチモーダルバックボーンのオープンウェイトアクセス。
コミュニティの視点
公式発表ではワールドモデルの機能が強調されていますが、Hacker News におけるコミュニティの反応は賛否両論です。一部のユーザーは近日公開予定のオープンウェイト「Dev」バージョンに興奮を示していますが、他のユーザーは発表で使用された用語に懐疑的です。
"オープンウェイトバージョンが SOTA であることを願っています。... Flux 3 に匹敵するアップデートされたオープンウェイトモデルがあることを本当に願っています。"
批判者は、初期のショーケースにおける人間の例の不足を指摘し、「World Model」という用語の使用を疑問視し、発表の言葉が「LLM slop writing」のように感じられると示唆しました。
"人々の例がほぼゼロしか示されなかった。 - World Model という用語の軽率な使用。 - 20 秒のビデオを主張しているが、ジャンプカットしか示していない。"
他のユーザーは、このモデルがヨーロッパのAI開発において大きな前進となる可能性があることを指摘しました。あるユーザーはこう述べました:
"ヨーロッパから生まれた、期待を抱かせる最初のAI製品。"
Sources
- HNFlux 3