hustvl/ControlAR

[ICLR 2025] ControlAR: Controllable Image Generation with Autoregressive Models

解决的问题

ControlAR 使使用自回归(AR)模型的可控图像生成成为可能,允许用户基于 Canny 边缘、深度图和分割掩码等空间控制来引导输出。它克服了标准 AR 模型在遵循精确空间约束方面的局限性,同时支持无需特殊标记或分辨率感知提示的任意分辨率生成。

工作原理

ControlAR 实现了一种条件解码策略,将空间控制视为序列视角问题。它与自回归模型(如 LlamaGen)集成,并使用控制编码器(如 DINOv2)处理空间条件。系统支持可调节的控制强度,以平衡空间引导与文本提示的影响。

适用人群

本项目专为从事图像合成的 AI 研究人员和开发者设计,特别适合那些希望从基于扩散的可控生成转向自回归架构的研究者。

主要亮点

  • 空间控制支持:支持 Canny、HED 和 Lineart 边缘、深度图以及分割掩码。
  • 任意分辨率:无需手工设计的标记即可生成各种尺寸的图像。
  • 高性能推理:包含使用 torch.compile 和 CUDA 图的快速推理引擎,单图像采样速度最高提升 11.4 倍。
  • 灵活控制:提供控制强度因子,可调节空间引导的强度。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • Dispatch