hustvl/ControlAR
[ICLR 2025] ControlAR: Controllable Image Generation with Autoregressive Models
解決的問題
ControlAR 使自回歸(AR)模型的可控圖像生成成為可能,允許使用者根據 Canny 邊緣、深度圖和分割遮罩等空間控制來引導輸出。它克服了標準 AR 模型在遵循精確空間約束方面的限制,同時支援無需特殊標記或解析度感知提示的任意解析度生成。
工作原理
ControlAR 實現了一種條件解碼策略,將空間控制視為序列觀點問題。它與自回歸模型(如 LlamaGen)整合,並使用控制編碼器(如 DINOv2)處理空間條件。系統支援可調節的控制強度,以平衡空間引導與文字提示的影響。
適用對象
本專案專為從事圖像合成的 AI 研究人員與開發者設計,特別適合那些希望從基於擴散的可控生成轉向自回歸架構的研究者。
主要亮點
- 空間控制支援:支援 Canny、HED 和 Lineart 邊緣、深度圖以及分割遮罩。
- 任意解析度:無需手動設計的標記即可生成各種尺寸的圖像。
- 高效率推論:內建使用
torch.compile和 CUDA 圖的快速推論引擎,單圖像採樣速度最高提升 11.4 倍。 - 靈活控制:提供控制強度因子,可調節空間引導的強度。
相關
- 專案
- 專案
- 專案
- 專案
- Dispatch