hustvl/ControlAR
[ICLR 2025] ControlAR: Controllable Image Generation with Autoregressive Models
解决的问题
ControlAR 使使用自回归(AR)模型的可控图像生成成为可能,允许用户基于 Canny 边缘、深度图和分割掩码等空间控制来引导输出。它克服了标准 AR 模型在遵循精确空间约束方面的局限性,同时支持无需特殊标记或分辨率感知提示的任意分辨率生成。
工作原理
ControlAR 实现了一种条件解码策略,将空间控制视为序列视角问题。它与自回归模型(如 LlamaGen)集成,并使用控制编码器(如 DINOv2)处理空间条件。系统支持可调节的控制强度,以平衡空间引导与文本提示的影响。
适用人群
本项目专为从事图像合成的 AI 研究人员和开发者设计,特别适合那些希望从基于扩散的可控生成转向自回归架构的研究者。
主要亮点
- 空间控制支持:支持 Canny、HED 和 Lineart 边缘、深度图以及分割掩码。
- 任意分辨率:无需手工设计的标记即可生成各种尺寸的图像。
- 高性能推理:包含使用
torch.compile和 CUDA 图的快速推理引擎,单图像采样速度最高提升 11.4 倍。 - 灵活控制:提供控制强度因子,可调节空间引导的强度。
相关
- 项目
- 项目
- 项目
- 项目
- Dispatch