hustvl/ControlAR

[ICLR 2025] ControlAR: Controllable Image Generation with Autoregressive Models

何を解決するか

ControlAR は自己回帰 (AR) モデルを用いた制御可能な画像生成を可能にし、Cannyエッジ、深度マップ、セグメンテーションマスクなどの空間制御に基づいて出力をガイドできます。標準的なARモデルが正確な空間制約を追従できないという制限を克服し、特別なトークンや解像度に依存するプロンプトを必要とせずに、任意解像度の生成をサポートします。

動作方法

ControlAR は空間制御をシーケンスの視点問題として扱う条件付きデコード戦略を実装しています。LlamaGen などの自己回帰モデルと統合され、DINOv2 などの制御エンコーダーを用いて空間条件を処理します。システムは、空間ガイドとテキストプロンプトの影響をバランスさせるために、調整可能な制御強度を提供します。

対象ユーザー

このプロジェクトは、画像合成に取り組むAI研究者や開発者を対象としており、特に拡散ベースの制御生成から自己回帰アーキテクチャへの移行に興味がある人向けです。

主な特徴

  • 空間制御対応: Canny、HED、Lineartエッジ、深度マップ、セグメンテーションマスクに対応。
  • 任意解像度: 手動で作成したトークンを必要とせず、さまざまなサイズの画像生成をサポート。
  • 高性能推論: torch.compile と CUDA グラフを活用した高速推論エンジンを搭載し、単一画像のサンプリングで最大11.4倍の高速化を実現。
  • 柔軟な制御: 空間ガイドの強度を調整できる制御強度ファクターを備えています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • Dispatch