Qwen-Image 출시: 네이티브 텍스트 렌더링 및 정밀 이미지 편집

TL;DR

Qwen은 고품질 텍스트 렌더링이라는 오랜 과제를 해결하기 위해 설계된 20B MMDiT 이미지 기반 모델인 Qwen-Image를 출시했습니다. 이 모델은 다중 라인 레이아웃, 영어와 중국어를 포함한 이중 언어 텍스트, 그리고 정밀 이미지 편집에서 뛰어난 성능을 보이며, 여러 생성 및 편집 벤치마크에서 기존 최첨단 모델들을 능가합니다.

네이티브 텍스트 렌더링 기능

Qwen-Image는 영어와 같은 알파벳 언어와 한자와 같은 표의문자 언어 모두를 지원하며, 다양한 언어와 레이아웃에 걸쳐 우수한 텍스트 렌더링을 제공합니다. 모델은 다음과 같은 복잡한 의미적·공간적 요구사항을 처리할 수 있습니다:

  • 다중 라인 및 단락 렌더링: 모델은 유리판과 같은 표면에 손글씨 스타일을 포함한 긴 텍스트 단락을 생성할 수 있으며, 텍스트가 전체 이미지 영역의 10% 미만을 차지하는 경우에도 정확성을 유지합니다.
  • 복합 레이아웃: Qwen-Image는 텍스트와 아이콘을 자동으로 구조화된 형식으로 배치할 수 있습니다. 예를 들어, 여러 서브모듈이 포함된 세련된 인포그래픽, 계층적 텍스트(제목, 부제, 출연진, 감독)가 있는 영화 포스터, 기업 스타일의 PPT 슬라이드 등이 있습니다.
  • 이중 언어 지원: 하나의 이미지 안에서 영어와 중국어를 전환하면서 두 언어 모두 높은 충실도를 유지합니다.
  • 서예 및 스타일화: 전통적인 중국 서예(대련, 가로 스크롤)와 같은 특정 예술적 스타일을 지원합니다.

이미지 편집 및 일반 생성

텍스트 렌더링을 넘어, Qwen-Image는 일반 시각 콘텐츠 제작을 위한 다목적 기반 모델입니다:

  • 정밀 이미지 편집: 향상된 다중 작업 학습 패러다임을 통해 스타일 전이, 객체 추가·삭제, 디테일 강화, 기존 텍스트 편집, 캐릭터 포즈 조정 등 다양한 편집 작업을 지원하며, 의미와 시각적 사실성을 유지합니다.
  • 일반 생성: 모델은 사진 실사 장면, 애니메이션 스타일, 인상파 회화, 미니멀리즘 디자인 등 다양한 예술적 스타일을 지원합니다.

벤치마크 성능

Qwen-Image는 공개 벤치마크 전반에 걸쳐 최첨단(SOTA) 성능을 달성하여 생성 및 편집 모두에서 강점을 입증합니다:

  • 일반 이미지 생성: GenEval, DPG, OneIG-Bench에서 평가됨.
  • 이미지 편집: GEdit, ImgEdit, GSO에서 평가됨.
  • 텍스트 렌더링: LongText-Bench, ChineseWord, TextCraft에서 특히 뛰어나며, 특히 중국어 텍스트 생성에서 이전 SOTA 모델들을 크게 앞섭니다.

Sources