Qwen-Image-2.0 リリース:プロフェッショナルなインフォグラフィックとフォトリアリズム

Qwen は、次世代の基礎的画像生成モデルである Qwen-Image-2.0 のリリースを発表しました。このモデルは画像生成と編集を単一のアーキテクチャに統合し、プロフェッショナルレベルのタイポグラフィ、複雑なインフォグラフィック作成、そして高忠実度のフォトリアリスティックレンダリングを可能にします。

統合生成・編集アーキテクチャ

Qwen-Image-2.0 は、以前は別々に開発されていた生成(精度とリアリズムに焦点)と編集(機能性と一貫性に焦点)の二つのトラックを統合します。これらを単一の「オムニ」モデルに統合することで、一方の領域での改善が直接もう一方に利益をもたらします。例えば、モデルの高度なテキスト描画機能により、パイプラインを切り替えることなく、編集プロセス中に既存の画像に詩や複雑なテキストを刻むことができます。

高度なタイポグラフィとインフォグラフィック機能

Qwen-Image-2.0 は、プロフェッショナルな文書およびグラフィックデザイン向けに設計されており、テキスト描画における5つの主要な強みがあります:

  • 精度("准"): モデルは、デュアルトラックのタイムラインなど、複雑な「ピクチャー・イン・ピクチャー」構成を生成でき、要素間の視覚的一貫性を保ちます。
  • 複雑性("多"): 1k トークンの指示をサポートし、複数列やデータテーブル、フローチャートを含む詳細な A/B テストレポートなど、非常に高度なリクエストに対応できます。
  • 美学("美"): モデルはレイアウトと構図を最適化し、テキストを空白領域に配置して視覚的対象を隠さないようにします。また、「細金」体や小楷など、さまざまな書道スタイルもサポートします。
  • リアリズム("真"): テキストはガラスホワイトボード、衣服、雑誌の表紙など、さまざまな媒体上で自然な照明、反射、遠近法を保持しながらリアルに描画されます。
  • 整列("齐"): モデルは、7 列のカレンダーグリッドや 4x6 の漫画パネルレイアウトなど、センタリングされた吹き出し内の対話を含む正確な構造的整列を実行できます。

フォトリアリズムと視覚的忠実度

  • ネイティブ 2K 解像度: モデルは 2048×2048 の解像度をサポートし、皮膚の毛穴、布の織り目、建築テクスチャ、自然の葉など、微細なディテールを表現できます。
  • 詳細な環境モデリング: モデルは、23 種類以上の緑色のシェードやリアルなティンドール光線など、生物学的・生態学的に高忠実度なシーンをレンダリングできます。
  • 解剖学的正確さ: モデルは、馬が人間の上に立つといった複雑な物理的相互作用や筋肉構造を正確に描写し、汗や皮膚のテクスチャを精密に表現します。

モデル効率とパフォーマンス

Qwen-Image-2.0 は、軽量なモデルアーキテクチャを採用し、推論速度を高速化しています。このモデルは 7B アーキテクチャとされ、数秒で 2K 画像を生成できます。AI Arena で実施されたブラインドテストでは、統合モデルとしてテキスト→画像および画像→画像のベンチマークの両方で優れた性能を示しました。

画像編集アプリケーション

統合モデルであるため、Qwen-Image-2.0 はいくつかの高度な編集タスクをサポートします:

  • 構成編集: 異なる画像から複数の被写体を合成し、一貫した照明と被写界深度を持つ自然な単一写真にします。
  • 次元横断編集: 平面的な漫画スタイルのイラストを実写の背景に統合し、元の写真のリアリティを保ちます。

Sources