Qwen VLo: 통합 멀티모달 이해 및 생성

Qwen VLo는 시각 인식과 창의적 생성 사이의 격차를 메우기 위해 설계된 통합 멀티모달 모델입니다. 주로 이해에 초점을 맞춘 이전 모델과 달리, Qwen VLo는 세계를 “이해”하고 그 이해를 바탕으로 고품질 재현을 생성할 수 있어, 사용자가 단일 인터페이스 내에서 분석에서 창작으로 이동할 수 있습니다.

통합 멀티모달 기능

Qwen VLo는 멀티모달 이해와 생성을 하나의 프레임워크에 통합하여 텍스트와 이미지 간의 양방향 흐름을 가능하게 합니다. 모델은 세 가지 주요 작동 모드를 지원합니다:

1. 자유형 이미지 편집 및 재현

Qwen VLo는 자연어를 이용한 지시 기반 편집을 지원합니다. 이를 통해 사용자는 의미적 일관성과 구조적 무결성을 유지하면서 기존 이미지에 복잡한 수정을 수행할 수 있습니다. 주요 기능은 다음과 같습니다:

  • 스타일 전이: 이미지를 Ghibli, 원피스, 드래곤볼, Pixar 3D와 같은 특정 예술 스타일로 변환합니다.
  • 객체 수정: 객체를 추가, 제거 또는 교체합니다(예: 수박을 두리안으로 교체하거나 개에 빨간 모자를 추가).
  • 장면 재구성: 배경을 변경합니다(예: 피사체를 방에서 에펠탑으로 이동) 또는 전체 분위기를 바꿉니다.
  • 복합 지시: 하나의 명령으로 다단계 작업을 수행합니다. 예를 들어 특정 레이아웃, 색상 구성, 손글씨 텍스트가 포함된 홍보 포스터를 만드는 경우.

2. 텍스트-이미지 생성

편집을 넘어, 모델은 텍스트 프롬프트로 완전히 새로운 이미지를 생성할 수 있습니다. 중국어와 영어의 이중 언어 지시를 지원하며, 사실적인 사진, 3D 렌더링, 전통 잉크화, 타이포그래피 아트 등 다양한 출력을 만들 수 있습니다.

3. 시각 인식 및 위치 지정

Qwen VLo는 강력한 이해 능력을 유지하여 간단한 편집 지시를 통해 전통적인 컴퓨터 비전 작업을 수행할 수 있습니다:

  • 탐지 및 세분화: 탐지 박스나 세분화 마스크를 생성합니다(예: 빨간 마스크를 사용해 바나나를 세분화).
  • 에지 탐지: 이미지에 대한 에지 탐지 맵을 예측합니다.
  • 자체 분석: 모델은 자신이 생성한 이미지를 재분석하여 방금 만든 개나 고양이의 품종과 같은 구체적인 세부 정보를 식별할 수 있습니다.

기술 구현 및 메커니즘

Qwen VLo는 출력에 대한 유연성과 제어를 향상시키기 위해 특정 아키텍처 선택을 활용합니다:

점진적 생성 프로세스

Qwen VLo는 이미지를 위에서 아래, 왼쪽에서 오른쪽으로 점진적으로 구성하는 생성 메커니즘을 사용합니다. 이 접근 방식은 특히 긴 텍스트 단락이나 만화 패널과 같은 복잡한 레이아웃 작업에서 생성 효율성을 높이고 더 나은 제어를 제공하도록 설계되었습니다.

동적 해상도 지원

동적 해상도 학습을 통해 모델은 임의의 해상도와 종횡비를 가진 입력 및 출력 이미지를 지원합니다. 이는 고정 형식의 제약을 없애고 웹 배너나 소셜 미디어 커버에 적합한 4:1 또는 1:3 비율과 같은 길쭉한 형식의 제작을 가능하게 합니다.

현재 제한 사항 및 향후 방향

프리뷰 버전인 Qwen VLo는 현재 몇 가지 과제에 직면하고 있습니다:

  • 안정성: 부정확성, 원본 이미지와의 불일치, 특정 지시를 따르지 못하는 경우가 발생할 수 있습니다.
  • 의도 인식: 모델이 생성된 이미지의 의도를 안정적으로 인식하는 데 가끔 어려움을 겪습니다.

앞으로 Qwen 팀은 생성 능력을 활용해 이해를 감독하고 정제하려고 합니다. 세분화나 탐지 맵과 같은 중간 결과를 생성함으로써 모델은 자체 시각 이해를 검증하고 전반적인 성능을 더욱 향상시킬 수 있습니다.

Sources