Qwen-Image リリース:ネイティブテキストレンダリングと精密画像編集

TL;DR

Qwen は、AI 生成画像における高忠実度テキストレンダリングという長年の課題を解決することを目的とした、20B MMDiT 画像基盤モデル Qwen-Image をリリースしました。このモデルは、複数行レイアウト、英語と中国語のバイリンガルテキスト、そして精密な画像編集に優れ、複数の生成および編集ベンチマークにおいて既存の最先端モデルを上回ります。

ネイティブテキストレンダリング機能

Qwen-Image は、英語のようなアルファベット言語と中国語のような表意文字言語の両方をサポートし、多様な言語とレイアウトにおいて優れたテキストレンダリングを提供します。モデルは、以下のような複雑な意味的・空間的要件に対応可能です。

  • マルチラインおよび段落レンダリング: モデルは、ガラス板などの表面に手書きスタイルを含む長文テキストを生成でき、テキストが画像全体のごく一部(全体の 1/10 未満)を占める場合でも精度を保ちます。
  • 複雑なレイアウト: Qwen-Image は、テキストとアイコンを自動的に構造化された形式に配置できます。例えば、複数のサブモジュールを持つエレガントなインフォグラフィック、階層的テキスト(タイトル、サブタイトル、キャスト、監督)を備えた映画ポスター、企業向け PPT スライドなどです。
  • バイリンガルサポート: モデルは、同一画像内で英語と中国語を切り替えることができ、両言語で高い忠実度を維持します。
  • 書道とスタイリゼーション: モデルは、対句や横巻きなどの伝統的な中国書道といった特定の芸術的スタイルをサポートします。

画像編集と汎用生成

テキストレンダリングに加えて、Qwen-Image は汎用的な視覚コンテンツ作成のための多用途基盤モデルです。

  • 精密画像編集: 強化されたマルチタスク学習パラダイムにより、モデルはスタイル転送、オブジェクトの追加・削除、ディテールの強化、既存テキストの編集、キャラクターのポーズ調整など、幅広い編集操作をサポートし、意味的な内容と視覚的リアリズムを保持します。
  • 汎用生成: モデルは、フォトリアリスティックなシーンやアニメスタイルから印象派の絵画、ミニマリストデザインに至るまで、さまざまな芸術スタイルをサポートします。

ベンチマーク性能

Qwen-Image は、幅広い公開ベンチマークにおいて最先端(SOTA)性能を達成し、生成と編集の両面での強みを示しています。

  • 汎用画像生成: GenEval、DPG、OneIG-Bench で評価。
  • 画像編集: GEdit、ImgEdit、GSO で評価。
  • テキストレンダリング: LongText-Bench、ChineseWord、TextCraft で特に優れ、特に中国語テキスト生成において従来の SOTA モデルを大幅に上回ります。

Sources