hustvl/ControlAR

[ICLR 2025] ControlAR: Controllable Image Generation with Autoregressive Models

解決的問題

ControlAR 使自回歸(AR)模型的可控圖像生成成為可能,允許使用者根據 Canny 邊緣、深度圖和分割遮罩等空間控制來引導輸出。它克服了標準 AR 模型在遵循精確空間約束方面的限制,同時支援無需特殊標記或解析度感知提示的任意解析度生成。

工作原理

ControlAR 實現了一種條件解碼策略,將空間控制視為序列觀點問題。它與自回歸模型(如 LlamaGen)整合,並使用控制編碼器(如 DINOv2)處理空間條件。系統支援可調節的控制強度,以平衡空間引導與文字提示的影響。

適用對象

本專案專為從事圖像合成的 AI 研究人員與開發者設計,特別適合那些希望從基於擴散的可控生成轉向自回歸架構的研究者。

主要亮點

  • 空間控制支援:支援 Canny、HED 和 Lineart 邊緣、深度圖以及分割遮罩。
  • 任意解析度:無需手動設計的標記即可生成各種尺寸的圖像。
  • 高效率推論:內建使用 torch.compile 和 CUDA 圖的快速推論引擎,單圖像採樣速度最高提升 11.4 倍。
  • 靈活控制:提供控制強度因子,可調節空間引導的強度。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • Dispatch