Qwen-Image-2.1 릴리스 노트 / 새로운 기능

Qwen-Image-2.1, 7B 파라미터 모델로 이미지 생성과 편집을 통합

Qwen-Image-2.1은 텍스트 기반 이미지 생성과 이미지 편집을 단일 아키텍처로 통합한 오픈 소스 이미지 모델입니다. 7B 파라미터와 32개의 Single-Stream DiT 레이어를 갖춘 시각적 생성 구성 요소를 특징으로 하며, 높은 생성 품질과 추론 효율성, 그리고 감소된 계산 비용 사이의 균형을 맞췄습니다.

네이티브 투명도 및 통합 생성

Qwen-Image-2.1은 투명 이미지(RGBA) 생성 및 편집을 위한 네이티브 지원을 제공하며, 이전에 Qwen-Image-Layered와 같은 전용 모델에서 볼 수 있었던 기능을 통합했습니다.

  • 텍스트-투-투명도(Text-to-Transparency): 이 모델은 프롬프트를 사용하여 표준 RGB 이미지를 출력할지, 아니면 투명 채널이 포함된 이미지를 출력할지 결정합니다.
  • 투명 레이어 편집: 사용자는 투명한 배경을 유지하면서 투명 레이어 내의 요소를 편집할 수 있습니다(예: 피사체의 표정 변경 또는 텍스트 수정(예: "BLOOM"을 "Qwen-Image"로 교체)).
  • 피사체 추출: 이 모델은 RGB 사진을 처리하여 디자인 및 구성에 사용할 수 있도록 특정 피사체를 투명도가 포함된 RGBA 레이어로 추출할 수 있습니다.

고급 이미지 편집 기능

Qwen-Image-2.1은 참조 용량, 로컬 제어 및 충실도에 중점을 둔 여러 이미지 편집 개선 사항을 도입했습니다.

다중 참조 이미지

이 모델은 최대 10개의 참조 이미지를 지원하여 여러 개의 서로 다른 자산을 하나의 일관된 구성으로 결합할 수 있습니다. 예시는 다음과 같습니다:

  • 그룹 초상화: 6개의 개별 초상화를 하나의 그룹 사진으로 결합.
  • 가상 착용(Virtual Try-on): 5개의 입력(모델, 의류, 신발, 가방, 모자)을 하나의 완전한 의상으로 병합.
  • 인테리어 디자인: 10개의 가구 이미지를 사용하여 완전한 방 배치를 생성.

로컬 편집 및 영역 선택

Qwen-Image-2.1은 편집 영역을 지정하기 위한 세 가지 방법을 제공합니다:

  1. 원(Circles): 서로 다른 색상의 원을 사용하여 동시 편집을 위한 여러 영역을 식별(예: 시계 제거, 머리 색상 변경, 의류 교체).
  2. 페인트 주석(Painted Annotations): 이미지의 특정 부분에 다이버를 추가하는 것과 같이 새로운 요소를 추가하기 위해 특정 영역을 흰색으로 표시.
  3. 별도 마스크(Separate Masks): 원본 이미지와 별도의 마스크를 두 개의 개별 입력으로 받아들여 마스크된 영역만 편집하면서 원본 콘텐츠를 보존.

순차적인 로컬 편집을 사용하여 나머지 장면을 보존하면서 연속적인 변경을 수행함으로써 간단한 애니메이션을 만들 수도 있습니다.

충실도 및 작업 범위

이 모델은 초상화의 정체성 보존(얼굴 특징)과 제품의 일관성(텍스트, 질감, 모양)을 향상시킵니다. 또한 작업 범위를 다음과 같이 확장했습니다:

  • 파노라마: 단일 셀카에서 파노라마 생성.
  • 인포그래픽: 모델 사진을 상세한 구성으로 확장.
  • 스토리보드: 3면 캐릭터 참조를 완전한 스토리보드로 변환.

추론 효율성 및 아키텍처

특히 다중 참조 이미지를 사용할 때 추론을 최적화하기 위해 Qwen-Image-2.1은 혼합 세분성 어텐션(mixed-granularity attention) 아키텍처를 사용합니다.

  • 어텐션 마스킹: 텍스트, 시스템 접두사 및 편집 지침은 토큰 수준의 인과 마스크(causal mask)를 사용하고, 이미지 생성은 청크 수준의 마스크를 사용합니다.
  • KV 캐시 재사용: 입력 이미지와 편집 지침은 정적 컨텍스트로 처리되며, 메모리 사용량을 줄이고 속도를 높이기 위해 첫 번째 단계에서 계산 및 캐시됩니다.

시각적 미학 및 타이포그래피

Qwen-Image-2.1은 타이포그래피와 초상화에 중점을 둔 세련된 미학을 특징으로 합니다. 텍스트 렌더링은 이제 서체 스타일, 레이아웃, 그리고 텍스트와 전체 구성 간의 관계를 고려합니다. 초상화 생성은 향상된 조명과 미세한 디테일을 통해 더욱 사실적인 모습으로 개선되었습니다.

Sources