Qwen-Image-2512 릴리스 노트 / 새로운 소식

Qwen-Image-2512는 전형적인 "AI 생성" 미학을 줄이고 더 높은 사실감과 섬세한 디테일을 제공하는 기본 텍스트-이미지 모델 업데이트입니다. 특히 인간 피사체, 자연 텍스처, 다중모달 텍스트 구성의 렌더링을 기본 Qwen-Image 모델(8월 출시) 대비 개선했습니다.

모델 성능 및 벤치마킹

Qwen-Image-2512는 블라인드 평가를 기반으로 가장 강력한 오픈소스 텍스트-이미지 모델로 자리매김하고 있습니다. Qwen 팀에 따르면, 이 모델은 AI Arena에서 10,000회 이상의 블라인드 평가를 거쳤으며, 폐쇄형 대안에 비해 여전히 높은 경쟁력을 유지했습니다.

향상된 인간 사실감

Qwen-Image-2512는 풍부한 얼굴 디테일과 더 나은 환경 컨텍스트를 추가하여 사람 묘사를 크게 개선합니다. 주요 개선 사항은 다음과 같습니다:

  • 연령 정확도: 모델은 노인 피사체의 주름과 같은 연령별 특징을 정확히 포착하여, 이전 AI 세대에서 흔히 보였던 인공적인 매끄러움을 피합니다.
  • 섬세한 디테일: 개별 머리카락을 정밀하게 렌더링함으로써 8월 릴리스에서 발견된 흐릿한 텍스처를 대체합니다.
  • 의미 일관성: 모델은 특정 몸 기울기나 표정과 같은 복잡한 자세 지시를 보다 정확히 따릅니다.
  • 환경 통합: 배경 객체(예: 기숙사 가구 또는 컨벤션 배너)가 더 선명하게 렌더링되고 피사체와 더 잘 통합됩니다.

더 섬세한 자연 디테일 및 텍스처

이 업데이트는 풍경, 야생동물 및 자연 요소에 고충실도 렌더링을 확장합니다:

  • 자연 및 풍경: 물 흐름, 잎사귀, 폭포 안개의 렌더링에서 개선이 눈에 띄며, 더 풍부한 녹색 그라데이션과 안개 및 스프레이와 같은 보다 현실적인 대기 효과를 제공합니다.
  • 동물 털: 모델은 골든 리트리버의 보호털과 부드러운 언더코트의 뚜렷한 층구조, 혹은 아르갈리 양의 거칠고 촘촘한 털과 같은 동물 텍스처를 고정밀로 구현합니다.

향상된 텍스트 렌더링 및 레이아웃

Qwen-Image-2512는 이미지 내 텍스트 요소의 정확도와 레이아웃을 향상시켜 보다 복잡한 다중모달 구성을 가능하게 합니다. 시연된 기능은 다음과 같습니다:

  • 구조화된 문서: 특정 타임라인, 라벨 및 방향 화살표가 포함된 전문 수준의 PPT 슬라이드를 생성할 수 있습니다.
  • 인포그래픽: 뚜렷한 레이아웃 블록, 특정 아이콘(예: 녹슨 기어, 원뿔 플라스크) 및 논리적 마커(예: 체크표시와 빨간 X)가 포함된 정확한 텍스트 라벨을 갖춘 산업 기술 인포그래픽을 제작합니다.
  • 복합 그리드: 각 셀이 일관된 서사 테마를 유지하면서도 독립적인 고품질 사진 장면을 구성하는 3x4 그리드와 같은 다중 패널 교육 포스터를 생성합니다.

Sources