Qwen-Image-Layered:层次化分解实现内在可编辑性
Qwen-Image-Layered 是一种模型,能够将单张图像分解为多个 RGBA 层,通过物理隔离语义或结构组件实现内在的可编辑性。这种方法使用户能够独立操作特定层,确保高保真编辑并在其余图像内容中保持一致性。
层次化分解与图像编辑
Qwen-Image-Layered 通过将图像拆分为独立的 RGBA 层,将光栅图像转换为结构化表示。这种对组件的物理隔离使得编辑操作能够精确进行,变更仅作用于目标层,而其他内容保持不变。
该层次化表示启用的关键功能包括:
- 重新着色:在不影响图像其他部分的情况下更改特定层的颜色。
- 对象替换:替换特定层(例如,将女孩换成男孩),同时保持背景和其他元素不变。
- 文本修订:在特定层内修改文本。
- 对象移除:通过删除对应的层来干净地去除不需要的对象。
- 缩放与重新定位:在不产生失真的情况下缩放对象,或在画布内自由移动对象。
灵活且可迭代的分解
该模型不依赖固定的层数,提供了图像结构的灵活性。Qwen-Image-Layered 支持可变层数的分解,这意味着用户可以根据任务的具体需求,将图像分解为不同数量的层(例如 3 层或 8 层)。
此外,模型支持递归分解。任何从初始分解生成的单独层都可以进一步分解为更多层,从而实现无限分解的过程,以对图像元素进行日益细致的控制。
技术意义
通过弥合光栅图像与结构化、可编辑表示之间的鸿沟,Qwen-Image-Layered 摒弃了传统的全局图像编辑,转向可组合的框架。这确保了诸如缩放和重新定位等基础操作能够保持高保真和一致性,因为结构组件被物理分离。