Qwen-Image-2512 リリースノート / 新機能

Qwen-Image-2512 は、従来の「AI生成」的な美学を抑え、より高いリアリズムと細部のディテールを実現する基礎的なテキストから画像へのモデルアップデートです。8 月にリリースされたベースの Qwen-Image モデルと比較して、人間の被写体、自然テクスチャ、マルチモーダルなテキスト構成の描写が特に向上しています。

モデル性能とベンチマーク

Qwen-Image-2512 は、ブラインド評価に基づく最も強力なオープンソースのテキストから画像へのモデルとして位置付けられています。Qwen チームによると、このモデルは AI Arena で 10,000 回以上のブラインド評価を受け、クローズドソースの代替品に対しても高い競争力を維持しました。

強化された人間のリアリズム

Qwen-Image-2512 は、より豊かな顔のディテールとより良い環境コンテキストを追加することで、人間の描写を大幅に洗練します。主な改善点は以下の通りです:

  • 年齢精度: モデルは高齢者のシワなど、年齢特有の手がかりを正確に捉え、従来の AI 世代でよく見られる人工的な滑らかさを回避します。
  • 細部ディテール: 個々の髪の毛一本一本の描写精度が向上し、8 月リリースで見られたぼやけたテクスチャが置き換えられます。
  • 意味的遵守: モデルは、特定の体の傾きや表情など、複雑な姿勢指示をより正確に遵守します。
  • 環境統合: 背景のオブジェクト(例:寮の家具やコンベンションのバナー)が、被写体とより高い明瞭さと統合性で描写されます。

より細かな自然ディテールとテクスチャ

このアップデートは、風景、野生動物、自然要素への高忠実度レンダリングを拡張します:

  • 自然と風景: 水の流れ、葉の描写、滝の霧のレンダリングに改善が見られ、緑の階調が豊かになり、霧やスプレーなどの大気効果がよりリアルになっています。
  • 動物の毛皮: モデルは、ゴールデンレトリバーのガードヘアと柔らかいアンダーコートの層状構造や、アルガリ羊の粗く密な毛皮など、動物テクスチャの高精度を実現します。

テキスト描画とレイアウトの改善

Qwen-Image-2512 は、画像内のテキスト要素の精度とレイアウトを向上させ、より複雑なマルチモーダル構成を可能にします。実証された機能は以下の通りです:

  • 構造化文書: 特定のタイムライン、ラベル、方向矢印を備えたプロフェッショナル品質の PPT スライドを生成する能力。
  • インフォグラフィック: 明確なレイアウトブロック、特定のアイコン(例:錆びた歯車、円錐形フラスコ)を備えた産業技術インフォグラフィックの作成と、チェックマークや赤いバツなどの論理マーカーを伴う正確なテキストラベル。
  • 複雑なグリッド: 各セルが一貫したストーリーテーマを保ちつつ、別個の高品質な写真シーンとなる 3×4 グリッドなどのマルチパネル教育ポスターの生成。

Sources