FLUX 3 发布:多模态流模型用于视觉智能
FLUX 3 发布:多模态流模型用于视觉智能
FLUX 3 是一个多模态基础模型,旨在超越孤立的模态学习。通过联合训练图像、视频和音频,模型发展出对物理现实的统一表示——捕捉空间结构、时间动态和声学因果关系——以便在不同媒体类型中实现更准确的预测和生成。
统一多模态架构
FLUX 3 基于 Self-Flow 方法,该方法在单一架构内对齐多模态生成与理解。与传统的流匹配(FM)不同,Self-Flow 使模型能够更高效地对齐这些模态。根据 Black Forest Labs 的说法,此架构使模型能够理解:“声音必须匹配冲击,运动必须服从质量,[并且] 未来必须继承过去。”
关键能力
视频和音频生成
FLUX 3 可以生成最高可达 20 秒的本地音频高多样性视频。其功能包括:
- Text-to-Video: 从纯文本提示创建剪辑。
- Image-to-Video: 为起始帧添加动画或使用图像作为视觉参考。
- Video-to-Video: 将源视频中的核心元素(如角色)带入新情境。
- Generative Continuation: 扩展现有的视频和音频序列。
- Keyframe-to-Video: 在定义的时刻之间创建受控过渡。
- Multilingual Dialogue: 生成多种语言的口头对话。
- Agentic Chaining: 将单个剪辑链接成更长的多镜头序列。
图像合成与编辑
FLUX 3 Image 通过增强处理复杂提示和在多种语言中高精度文本渲染的能力,在各种风格和分辨率下改进了之前的 FLUX 版本。
动作预测与物理 AI
该模型的世界理解通过两种方法应用于动作预测:将动作预测原生集成到 FLUX 3 骨干网络以及使用预训练的视频骨干网络作为专门动作模型的基础。与 mimic robotics 的合作产生了 FLUX-mimic,这是一个专门用于生产环境中灵巧操作的视频-动作模型,目前正在奥迪进行测试。
性能评估
初步评估表明,在直接对比中,FLUX 3 Video 被优先选择超过几个竞争模型。偏好率如下:
| 模型 | 偏好率 |
|---|---|
| Luma Ray 3.2 | 93% |
| Runway Gen-4.5 | 77% |
| Grok Imagine Video | 69% |
| Kling v3 Pro | 60% |
| Happy Horse v1 | 59% |
| Happy Horse 1.1 | 57% |
| Seedance 2.0 | 52% |
| Gemini Omni Flash | 52% |
发布计划与访问
Black Forest Labs 将通过早期访问阶段推出以下功能:
- FLUX 3 Video: 通过 API 和私有权重访问进行视频和音频生成/编辑。
- FLUX 3 Action: 通过研究和商业合作伙伴(例如 mimic robotics)进行动作预测。
- FLUX 3 Image: 通过 API 和私有权重访问进行图像合成与编辑。
- FLUX 3 Dev: 多模态骨干网络的开放权重访问,用于内容创作和动作预测。
社区视角
虽然官方公告强调了世界模型能力,但 Hacker News 上的社区反应褒贬不一。一些用户对即将推出的开放权重 “Dev” 版本表示兴奋,而另一些用户对公告中使用的术语持怀疑态度。
"我希望开放权重版本能够达到 SOTA。... 我真的希望 Flux 3 拥有可比的更新开放权重模型。"
批评者指出初次展示中缺乏人类示例,并质疑了“World Model”一词的使用,认为公告的语言感觉像是 “LLM slop 写作”。
"展示了几乎零的人类示例。- 对 World Model 术语的滥用。- 声称有 20 秒视频,仅展示跳切。"
其他用户指出,该模型有望成为欧洲 AI 发展的重要一步,正如一位用户所说:“来自欧洲的首个 AI 事物,带来高度期望。“
Sources
- HNFlux 3