FLUX 3 と FLUX-mimic: 物理的 AI 向けビデオアクションモデルの統合
FLUX 3 と FLUX-mimic: 物理的 AI 向けビデオアクションモデルの統合
FLUX-mimic はビデオ生成を活用して物理ロボットを駆動する
FLUX-mimic は、Black Forest Labs (BFL) と mimic robotics の協力により開発された次世代のビデオアクションモデルです。FLUX 3 マルチモーダルファンデーションモデルをバックボーンとして利用し、視覚的知性を物理的行動に変換することで、Audi のような実際の生産環境においてロボットが複雑な操作タスクを実行できるようにします。
FLUX-mimic の核となる考えは、現実的なビデオを生成できるモデルは必然的に「ワールドモデル」―接触、運動、重量、因果関係の内部表現―を学習するということです。この学習された表現から行動をデコードすることにより、FLUX-mimic はコンテンツ作成ツールを物理的 AI のシステムに変換します。
FLUX 3 マルチモーダルバックボーン
FLUX 3 は、画像、ビデオ、オーディオ全体にわたって共同訓練される単一のモデルです。BFL の説明によると、ビデオ予測はトレーニングにおいて最も計算コストが高い部分であり、総計算コストの 95% 以上を占めています。この強度は必要不可欠で、現実的なビデオ生成には、物理世界の挙動を正確にシミュレートするモデルが必要だからです。
アクション予測の統合
BFL は、FLUX 3 のカリキュラムにアクション予測を追加しても、その生成能力が永久に低下しないことを発見しました。大規模なトレーニング中、テキストからビデオおよび画像からビデオへの人間の評価は最初に最大 10% 低下しましたが、3,500 ステップ後には完全な品質を取り戻しました。これは、ビデオ生成とアクション予測が容量を競合することなく単一のバックボーンを共有できることを示しています。
表現学習のための Self-Flow
ロボティクスでワールドモデルを使えるようにするため、BFL は Self-Flow と呼ばれるフレームワークを利用しました。標準的な生成モデルはしばしばダウンストリームタスクでの有用性を制限する「絡み合った」表現を生成しますが、Self-Flow は生成と表現学習を統合します。これにより、相互的な改善がもたらされます:モダリティ全体で生成品質が向上し、シミュレーションにおけるロボット制御タスクの成功率が向上します。
ワールドモデルからファクトリー導入へ
FLUX-mimic は、FLUX 3 バックボーンを汎用的な操作タスクに適用します。軽量なアクションデコーダーを採用し、これは FLUX バックボーンのビデオ予測パスから抽出された中間特徴上で訓練されています。
Audi における実際の応用
Audi の生産および物流オペレーションに導入された FLUX-mimic は、従来の自動化では不可能だったタスクを処理できることを実証しており、以下を含みます:
- 構造化トレイへの部品のキッティング。
- ぴったりと合うフィクスチャーへの電子制御ユニットの挿入。
- コンポーネントの組み立て。
- シールやケーブルなどの柔らかく柔軟な素材の取り扱い。
サンプル効率と堅牢性
ワールドの物理法則はすでに FLUX 3 の表現に組み込まれているため、新しいタスクごとに世界の仕組みを教える必要はありません。これにより、効率において大きな向上が得られます:
- データ要件の削減: Self-Flow の実験では、Self-Flow なしのモデルと比較して、アクション予測が目標成功率に到達するまでのトレーニングステップが半分になりました。
- サンプル効率の向上: mimic-video の調査によると、ビデオアクションモデルはビジョンランゲージアクション (VLA) モデルと比較して最大 10 倍のサンプル効率を達成します。
- 自律的な回復: モデルは、デモンストレーションセットでその特定の失敗ケースを明示的に示されなくても、失敗(たとえば、ミスした把持の修正)から回復できます。代わりに内部のワールドモデルに依存します。
パフォーマンスとレイテンシー制約
ファクトリーフロアで実用化するためには、モデルは人間の視覚反応に匹敵する反応時間で動作する必要があります。
ハードウェア最適化
構造化されたワールドモデルを使用することで、BFL はより小さなバックボーンを使って高いパフォーマンスを達成でき、これによりレイテンシーが削減されます。FLUX-mimic バックボーンは、単一の NVIDIA RTX 5090 GPU 上で入力からワールド表現への処理を 80ms 未満で行うことができます。
システム全体のレイテンシー
mimic のデプロイメントスタックを通じて(アクションデコーダーの最適化およびセンサーとアクチュエータ間のプロセス間レイテンシーの削減を含む)、総システム反応時間は 101ms です。
コミュニティの洞察
業界の観察者と開発者は、このアプローチの含意、特に生成ビデオモデルからワールドモデルを導き出す能力について言及しています。
"よく訓練されたマルチモーダルビデオ生成モデルには、内部にワールド表現モデルが訓練されています。彼らはこのワールドモデルを取り出し、ロボットに導入する作業を行ってきました... ビデオモデルを訓練し、ビデオ生成を販売し、スケールを拡大し、そのスケールを使ってロボット関連のものを訓練することで利益を得ます。"
他の観察者は、モデルが自律的にエラーを解決できる能力を強調し、コンポーネントを再座席させるために複数回試みるロボットの能力が、ロボットの解決能力における重要な進歩であると指摘しました。