Qwen-Image-Edit 릴리즈 노트
Qwen-Image-Edit은 20B Qwen-Image 기반 위에 구축된 특화된 이미지 편집 모델입니다. 시각적 의미 제어를 위해 Qwen2.5-VL을, 시각적 외관 제어를 위해 VAE 인코더를 동시에 활용하여 고품질 의미 및 외관 편집과 정밀한 양언어 텍스트 수정을 가능하게 합니다.
의미 및 외관 편집을 위한 이중 제어 아키텍처
Qwen-Image-Edit은 의미 편집과 외관 편집이라는 두 가지 구별되는 이미지 수정 유형을 처리하기 위해 이중 입력 메커니즘을 사용합니다.
의미 편집
의미 편집은 원본 시각적 의미와 정체성을 유지하면서 이미지 내용을 수정합니다. 이는 전체 픽셀이 변할 수 있지만 핵심 대상은 일관성을 유지하는 고수준 변화를 가능하게 합니다. 주요 기능은 다음과 같습니다:
- IP 생성 및 일관성: 모델은 다양한 시나리오에서 일관된 캐릭터(예: Qwen의 카피바라 마스코트)를 포함한 다양한 콘텐츠를 생성할 수 있으며, 테마 이모지 팩을 만드는 등 활용할 수 있습니다.
- 새로운 시점 합성: 모델은 객체를 90도 회전하거나 전체 180도 회전시켜 객체의 뒷면을 드러낼 수 있습니다.
- 스타일 전이: 초상화를 스튜디오 지브리와 같은 다양한 예술 스타일로 변환하여 가상 아바타 생성 등 다양한 용도로 활용할 수 있습니다.
외관 편집
외관 편집은 이미지의 특정 영역만을 변경하고 나머지 모든 영역은 완전히 유지하는 저수준 시각적 수정에 초점을 맞춥니다. 주요 기능은 다음과 같습니다:
- 요소 수정: 특정 요소를 추가하거나 제거합니다. 예를 들어, 반사 효과가 있는 간판을 삽입하거나 가는 머리카락을 제거하는 것이 가능합니다.
- 정밀 색상 조정: 단어의 한 글자와 같이 작은 요소의 색상을 수정합니다.
- 환경 변화: 배경을 조정하거나 인물의 옷을 교체합니다.
정밀 양언어 텍스트 편집
Qwen-Image-Edit은 Qwen-Image의 텍스트 렌더링 기능을 확장하여 정밀한 양언어(중국어 및 영어) 텍스트 편집을 지원합니다. 모델은 이미지 내 텍스트를 추가, 삭제 또는 수정하면서 원본 글꼴, 크기 및 스타일을 유지할 수 있습니다. 이 기능을 통해 대형 헤드라인부터 중국 포스터의 작고 복잡한 세부 텍스트까지 복잡한 텍스트 요소를 교정할 수 있습니다.
연쇄 편집 워크플로우
Qwen-Image-Edit은 복잡한 오류를 교정하기 위해 연쇄적인 단계별 편집 방식을 지원합니다. 이미지에 교정할 영역을 표시하는 바운딩 박스를 그려 사용자는 출력을 반복적으로 다듬을 수 있습니다. 예를 들어, 서예 작품에서 모델을 사용해 특정 문자 오류를 하나씩 교정하고, 문자의 모호한 구성 요소를 미세 조정하여 최종 결과를 정확하게 만들 수 있습니다.
성능 및 가용성
다수의 공개 벤치마크 평가 결과 Qwen-Image-Edit이 이미지 편집 작업에서 최첨단(SOTA) 성능을 달성함을 보여줍니다. 이 모델은 Qwen Chat의 "Image Editing" 기능을 통해 제공되며, 가중치는 GitHub, Hugging Face, ModelScope에 호스팅되어 있습니다.