hustvl/ControlAR
[ICLR 2025] ControlAR: Controllable Image Generation with Autoregressive Models
何を解決するか
ControlAR は自己回帰 (AR) モデルを用いた制御可能な画像生成を可能にし、Cannyエッジ、深度マップ、セグメンテーションマスクなどの空間制御に基づいて出力をガイドできます。標準的なARモデルが正確な空間制約を追従できないという制限を克服し、特別なトークンや解像度に依存するプロンプトを必要とせずに、任意解像度の生成をサポートします。
動作方法
ControlAR は空間制御をシーケンスの視点問題として扱う条件付きデコード戦略を実装しています。LlamaGen などの自己回帰モデルと統合され、DINOv2 などの制御エンコーダーを用いて空間条件を処理します。システムは、空間ガイドとテキストプロンプトの影響をバランスさせるために、調整可能な制御強度を提供します。
対象ユーザー
このプロジェクトは、画像合成に取り組むAI研究者や開発者を対象としており、特に拡散ベースの制御生成から自己回帰アーキテクチャへの移行に興味がある人向けです。
主な特徴
- 空間制御対応: Canny、HED、Lineartエッジ、深度マップ、セグメンテーションマスクに対応。
- 任意解像度: 手動で作成したトークンを必要とせず、さまざまなサイズの画像生成をサポート。
- 高性能推論:
torch.compileと CUDA グラフを活用した高速推論エンジンを搭載し、単一画像のサンプリングで最大11.4倍の高速化を実現。 - 柔軟な制御: 空間ガイドの強度を調整できる制御強度ファクターを備えています。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- Dispatch