Flux 3 Image 发布 – 最大程度的像素级控制与精准编辑
Flux 3 Image 发布 – 最大程度的像素级控制与精准编辑
Flux 3 Image 引入了一种基于布局的工作流,其中每个视觉元素都由一个边界框和文本描述定义,从而实现像素级精准构图和针对性编辑,同时保留图像其余部分的完整性。
Flux 3 Image 的不同之处
Flux 3 Image 允许您通过在显式边界框内描述元素来控制每个像素。
- 用户在 0 到 1000 的网格上绘制一个框,分配一个 ID 和自然语言描述(例如
dome_1[250,150,650,850]→ “一个巨大、光滑的浅色混凝土抛物面穹顶”)。 - 一个全局场景描述将所有元素串联起来(例如 “一个发光的混凝土穹顶从暮色海湾中升起,海滩前有一群人群。”)。
- 模型以原生 4K 分辨率渲染整个画布,保留纹理、反射和小文字等精细细节。
- 生成后,任何框都可以被编辑、移动或替换,而不会影响未触碰的区域,支持迭代式、像素级编辑。
核心工作流
- 定义宽高比 – 选择任意形状;画布始终覆盖 0 到 1000 的坐标系统。
- 创建元素表 – 一个 JSON 数组,其中每个条目包含
id、bbox和desc。 - 编写全局描述 – 一句引用 ID 的描述性句子。
- 生成 – Flux 3 Image 用描述内容填充每个框。
- 编辑 – 修改 JSON(或重新绘制框)并重新运行生成;未更改的框保持完全不变。
“为每个重要的元素拖出一个框,然后描述框内内容。” – Black Forest Labs 文档
示例:"Le Festival du Soleil"
该页面展示了一个由五个框构建的复杂构图:
| ID | 边界框 | 描述 |
|---|---|---|
Fr_Text_1 |
[10,200,170,800] |
"在浅奶油色的纤细优雅衬线字体中书写着 "LE FESTIVAL DU SOL"" |
town_1 |
[280,700,420,1000] |
"山脚下沿海小镇的微弱灯光和小型建筑" |
dome_1 |
[250,150,650,850] |
"一个巨大、光滑的浅色混凝土抛物面穹顶" |
swimmers_1 |
[580,200,720,800] |
"数十个小型剪影人物散落在黑暗水域中,正在涉水" |
crowd_1 |
[740,0,1000,1000] |
"一群穿着休闲、浅色夏季服装的人们坐在沙滩上" |
全局描述为:“一个发光的混凝土穹顶从暮色海湾中升起,海滩前有一群人群。” Flux 3 Image 按照描述填充每个区域,生成一幅连贯的夜景插画。
精准编辑用例
该平台支持像素级编辑,例如在保持周围波浪、天空和构图不变的情况下,重新着色冲浪者的潜水服。编辑记录显示原始 ID(surfer_wetsuit、surfboard)和新描述(亮红色氯丁橡胶潜水服、亮红色冲浪板)。所有其他元素(ocean_wave、cloudy_sky)保持锁定。
商业可用性
Flux 3 Image 以 商业权重许可 提供,适用于需要大规模生成的企业。公司可在私有基础设施上对模型进行微调并自托管。销售咨询请通过 Black Forest Labs 联系表单提交。
Hacker News 社区反应
用户体验赞誉 – 用户强调了放置元素的直观界面:
"用户体验看起来非常棒且易于操控,祝贺团队专注于界面设计。" – @arnaudsm
与其他工具的对比 – 评论者指出与 Ideogram V4 的基于 JSON 布局相似,但认为 Flux 3 的 UI 更不繁琐:
"他们似乎特别强调能够将特定元素放置在图像中指定位置的用户体验。……这确实有点麻烦。我可能会等到它开放权重版本发布再尝试……" – @vunderba
对开放权重的期待 – 多位用户表达了对未来的开放权重版本的期待:
"我认为我们都在等待开放权重或本地模型的发布。" – @vergessenmir
实际成功案例 – 早期采用者报告了工作流速度的切实提升:
"我尝试用它快速替换截图中的 UI 元素,第一次尝试就准确生成了我标记的 3/4 个元素。……这种细粒度的迭代,正是它在行业范围内变得有用的关键。" – @soundworlds
局限性 – 部分用户遇到在小文字或复杂物体上精确编辑失败的边缘情况:
"我尝试用一张有围栏的马的照片进行精确编辑,一次尝试就失败了……" – @pks016
常见问题(摘录)
- 什么是 Flux 3 Image? – 它是 Black Forest Labs 多模态 Flux 3 系列中的图像生成与编辑组件。
- 边界框如何工作? – 边界框在 0-1000 网格上定义为
[y_min, x_min, y_max, x_max];每个框都与文本描述配对。 - 我必须手动绘制每个框吗? – 不必。LLM 可以自动提出布局,您随后可调整不喜欢的框。
- 我可以编辑现有图像吗? – 可以。重新描述、移动或替换单个框;未触碰的框保持完全不变。
- 哪些类型的图像最受益? – 复杂拼贴、编辑版面、UI 原型,或任何需要精确空间关系的场景。
开始使用
- 访问 Flux 3 Image Playground 以绘制框并输入描述。
- 使用 API(文档链接位于 Black Forest Labs 官网)进行程序化生成与编辑。
- 用于商业用途,请联系销售以获取商业权重许可和自托管条款。
Flux 3 Image 代表了可控生成式 AI 的一大进步,赋予创作者精确控制构图的能力,同时仍能享受模型的创造性合成能力。
Sources
相关
- 项目
- Dispatch
- Dispatch
- 项目
- 项目