FLUX 3 和 FLUX-mimic:将视频-动作模型集成到物理 AI 中

FLUX 3 和 FLUX-mimic:将视频-动作模型集成到物理 AI 中

FLUX-mimic 利用视频生成驱动物理机器人

FLUX-mimic 是由 Black Forest Labs(BFL)与 mimic robotics 合作开发的下一代视频-动作模型。它将 FLUX 3 多模态基础模型作为骨干网络,将视觉智能转化为物理动作,使机器人能够在真实世界的生产环境中执行复杂的操作任务,例如奥迪的生产线。

FLUX-mimic 的核心论点是,能够生成逼真视频的模型必然内在地学习到一个“世界模型”——即接触、运动、重量和因果关系的内部表示。通过从这个学习到的表示中解码动作,FLUX-mimic 将内容创作工具转变为物理 AI 系统。

FLUX 3 多模态骨干网络

FLUX 3 是一个在图像、视频和音频上联合训练的单一模型。根据 BFL 的说法,视频预测是训练中计算需求最大的部分,占总计算成本的 95% 以上。这种强度是必要的,因为逼真的视频生成要求模型准确模拟物理世界的行为。

动作预测的集成

BFL 发现,将动作预测加入 FLUX 3 的训练课程不会永久性地降低其生成能力。在大规模训练过程中,人类对文本到视频和图像到视频的评分最初下降了多达 10%,但在 3,500 步后模型恢复了全部质量。这表明视频生成和动作预测可以共享单一骨干网络而不争夺容量。

用于表示学习的 Self-Flow

为了使世界模型可用于机器人,BFL 采用了一种称为 Self-Flow 的框架。虽然标准生成模型经常产生“纠缠”的表示,限制了其在下游任务中的实用性,但 Self-Flow 统一了生成和表示学习。这带来了互惠的改进:跨模态的生成质量提升,且在仿真中机器人控制任务的成功率提高。

从世界模型到工厂部署

FLUX-mimic 将 FLUX 3 骨干网络应用于通用操作任务。它采用一个轻量级的动作解码器,该解码器在从 FLUX 骨干网络的视频预测路径提取的中间特征上进行训练。

在奥迪的实际应用

在奥迪的生产和物流操作中部署后,FLUX-mimic 展示了处理传统自动化 previously 无法完成的任务的能力,包括:

  • 将零件装入结构化托盘。
  • 将电子控制单元插入紧密配合的夹具中。
  • 组装组件。
  • 处理软性柔性材料,如密封件和电缆。

样本效率和鲁棒性

由于世界的物理特性已经嵌入 FLUX 3 的表示中,模型不需要为每个新任务重新教授世界的工作方式。这带来了效率的显著提升:

  • 数据需求降低: 在 Self-Flow 实验中,动作预测在达到目标成功率所需的训练步数仅为不使用 Self-Flow 的模型的一半。
  • 样本效率提升: mimic-video 研究表明,视频-动作模型相比视觉-语言-动作(VLA)模型的样本效率最高可提升 10 倍。
  • 自主恢复: 模型能够从故障中恢复(例如,纠正未成功的抓取),而无需在演示集中明确展示该特定故障案例;相反,它依赖其内部世界模型。

性能和延迟约束

为了在工厂地面上可行,模型必须以与人类视觉响应相当的反应时间运行。

硬件优化

通过使用结构良好的世界模型,BFL 可以使用更小的骨干网络以实现高性能,从而降低延迟。FLUX-mimic 骨干网络在单个 NVIDIA RTX 5090 GPU 上可将输入处理为世界表示的时间低于 80ms。

系统范围内的延迟

通过 mimic 的部署栈——其中包括优化动作解码器以及减少传感器和执行器之间的进程间延迟——总系统反应时间为 101ms。

社区见解

行业观察者和开发者已经指出了这种方法的含义,具体来说,就是能够从生成式视频模型中推导出世界模型。

"一个训练良好的多模态视频生成模型内部包含一个经过训练的世界表示模型。他们已经完成了一些工作,将这个世界模型提取出来并部署到机器人上……训练视频模型,销售视频生成,扩大规模,利用规模来训练机器人相关的事物:获利。"

其他观察者强调了模型自主解决错误的能力,指出机器人多次尝试重新就位一个部件的能力是机器人故障解决能力的重大进步。

Sources