hustvl/ControlAR
[ICLR 2025] ControlAR: Controllable Image Generation with Autoregressive Models
해결하는 문제
ControlAR는 자기회귀(AR) 모델을 사용한 제어 가능한 이미지 생성을 가능하게 하며, Canny 에지, 깊이 맵, 세그멘테이션 마스크와 같은 공간 제어를 기반으로 출력을 안내할 수 있습니다. 일반적인 AR 모델이 정밀한 공간 제약을 따르는 데 한계가 있는 점을 해결하며, 특수 토큰이나 해상도 인식 프롬프트 없이도 임의 해상도 생성을 지원합니다.
작동 방식
ControlAR는 공간 제어를 시퀀스 관점 문제로 다루는 조건부 디코딩 전략을 구현합니다. LlamaGen과 같은 자기회귀 모델과 통합되며, DINOv2와 같은 제어 인코더를 사용해 공간 조건을 처리합니다. 시스템은 공간 가이드와 텍스트 프롬프트의 영향을 조절할 수 있는 조절 가능한 제어 강도를 제공합니다.
대상 사용자
이 프로젝트는 이미지 합성에 종사하는 AI 연구자 및 개발자들을 대상으로 하며, 특히 확산 기반의 제어 가능한 생성에서 자기회귀 아키텍처로의 전환에 관심이 있는 사람들을 위한 것입니다.
주요 특징
- 공간 제어 지원: Canny, HED, Lineart 에지, 깊이 맵, 세그멘테이션 마스크와 함께 작동합니다.
- 임의 해상도 지원: 수작업으로 만든 토큰 없이 다양한 크기의 이미지를 생성할 수 있습니다.
- 고성능 추론:
torch.compile과 CUDA 그래프를 사용한 빠른 추론 엔진을 포함하여, 단일 이미지 샘플링에서 최대 11.4배 빠른 성능을 달성합니다. - 유연한 제어: 공간 가이드의 강도를 조절할 수 있는 제어 강도 요소를 제공합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- Dispatch