Qwen-Image-3.0 릴리스 노트
Qwen은 Qwen-Image-3.0을 출시했습니다. 이는 이미지 생성을 단순히 미학적인 수준에서 실용적인 생산성 도구로 전환하도록 설계된 3세대 기반 이미지 생성 모델입니다. 모델은 "Real"(实)이라는 개념을 중심으로 하며, 이는 풍부한 콘텐츠, 정교한 디테일, 깊은 지식이라는 세 가지 주요 기술 기둥을 통해 구현됩니다.
풍부한 콘텐츠: 복잡한 레이아웃 및 고토큰 입력
Qwen-Image-3.0은 허용 가능한 명령 길이를 4.5k 토큰으로 늘려 매우 복잡하고 정보가 밀집된 시각 레이아웃을 렌더링할 수 있습니다. 이를 통해 모델은 이미지 구성을 가로 확장과 세로 깊이 모두 처리할 수 있습니다.
가로 확장 및 공간 제어
모델은 높은 의미적 병치와 공간 제어를 보여주어, 서로 간섭 없이 하나의 이미지에 여러 개의 독립적인 개념을 배치할 수 있습니다. 이 능력의 예로는 3.7k 토큰 프롬프트를 기반으로 각 셀에 복잡한 인포그래픽(예: 수학 기호, 생물학 설명, 의료 도표)이 포함된 3x3 그리드를 한 번에 생성하는 경우가 있습니다.
세로 깊이 및 논리적 중첩
병렬 요소를 넘어 모델은 의미적 분해와 논리적 중첩을 지원합니다. 하나의 이미지 안에 여러 중첩 인터페이스를 레이어별로 렌더링할 수 있는데, 예를 들어 VSCode 인터페이스 안에 Qwen Chat 인터페이스가 포함되고, 그 안에 WeChat 인터페이스와 커피 포스터가 포함되는 식으로 각 UI 레이어의 고유한 스타일을 유지합니다.
정교한 디테일: 마이크로 수준 정밀도
Qwen-Image-3.0은 마이크로 수준 디테일에 대한 높은 렌더링 정밀도를 달성하며, 가독성과 사진 같은 사실성을 중시합니다.
정밀 텍스트 렌더링
모델은 10px 크기의 텍스트까지 렌더링할 수 있어 밀집된 환경에서도 가독성을 확보합니다. 주요 기능은 다음과 같습니다:
- 학술 논문: LaTeX 수식, 아래첨자·위첨자, 그리스 문자, 정리 번호 등을 정확히 렌더링합니다.
- 실제 문서: 신문 형식의 밀집 텍스트를 생성하여 실제 신문의 외관을 시뮬레이션합니다.
- 손글씨 주석: 빨간색 손글씨 메모(밑줄, 화살표 포함)를 현실감 있게 오버레이하여 학생의 수업 노트를 재현합니다.
질감 및 복원
모델은 모공과 털결을 포함한 사실적인 피부 질감을 생성합니다. 편집 작업에서는 원본 예술 스타일, 먹물 그라데이션, 붓놀림을 유지하면서 곰팡이 얼룩과 손상을 제거하여 손상된 전통 회화를 복원할 수 있습니다.
깊은 지식: 다국어 및 세계 인식
Qwen-Image-3.0은 방대한 세계 지식을 활용해 다양한 스타일과 인터페이스를 렌더링합니다.
다국어 및 UI 지원
모델은 12개 언어를 기본적으로 렌더링하며 100가지가 넘는 예술 스타일을 지원합니다. 웹 페이지, 게임, 라이브 스트림 등 주류 사용자 인터페이스를 시뮬레이션할 수 있습니다.
지식 기반 생성
모델은 간단한 사진을 전문 연구 도표로 변환할 수 있으며, 여기에는 분류학 정보, 형태학 주석, 스케일 바가 추가됩니다. 또한 인터넷에 연결해 최신 정보를 가져와 특정 날짜와 위치의 날씨 예보 이미지를 생성하거나, 특정 IP 인물을 장면에 삽입하는 등 활용이 가능합니다.