Qwen-Image-Edit リリースノート

Qwen-Image-Edit は、20B の Qwen-Image 基盤の上に構築された専門的な画像編集モデルです。Qwen2.5-VL を視覚的セマンティック制御に、VAE Encoder を視覚的外観制御に同時に利用することで、高品質なセマンティック編集と外観編集、そして正確なバイリンガルテキスト修正を実現します。

セマンティック編集と外観編集のデュアルコントロールアーキテクチャ

Qwen-Image-Edit は、2 つの異なる画像修正タイプ(セマンティック編集と外観編集)を処理するためのデュアルインプット機構を採用しています。

セマンティック編集

セマンティック編集は、元の視覚的セマンティクスとアイデンティティを保持しながら画像内容を変更します。全体のピクセルは変化しても、核心となる対象は一貫したままです。主な機能は次のとおりです。

  • IP 作成と一貫性: モデルは、さまざまなシナリオで一貫したキャラクター(例: Qwen のカピバラマスコット)を特徴とする多様なコンテンツを生成でき、テーマ別絵文字パックの作成などに利用できます。
  • 新視点合成: オブジェクトを 90 度回転または 180 度フル回転させ、背面を見せることができます。
  • スタイル転送: ポートレートをスタジオジブリ風などのさまざまな芸術的スタイルに変換し、バーチャルアバター作成などのユースケースに活用できます。

外観編集

外観編集は、特定の領域だけを変更し、画像の他のすべての部分を完全にそのままに保つ低レベルの視覚的修正に焦点を当てます。主な機能は次のとおりです。

  • 要素の修正: 看板とそれに対応する反射を挿入したり、細かい髪の毛を除去したりと、特定の要素を追加または削除できます。
  • 正確な色調整: 単語中の一文字など、特定の小さな要素の色を変更できます。
  • 環境の変更: 背景を調整したり、人物の服装を変更したりできます。

正確なバイリンガルテキスト編集

Qwen-Image-Edit は、Qwen-Image のテキスト描画機能を拡張し、正確なバイリンガル(中国語と英語)テキスト編集をサポートします。モデルは画像内のテキストを追加、削除、変更でき、元のフォント、サイズ、スタイルを保持します。この機能により、中国語ポスターの大見出しや小さく複雑な文字など、複雑なテキスト要素の修正が可能になります。

連鎖的編集ワークフロー

Qwen-Image-Edit は、複雑なエラーを修正するための段階的な連鎖編集アプローチをサポートします。画像上にバウンディングボックスで修正領域をマークし、ユーザーは出力を繰り返し洗練させることができます。たとえば、書道作品において、モデルを使って特定の文字エラーを一つずつ修正し、文字の曖昧な部分を微調整して最終的に正確な結果を得ることができます。

パフォーマンスと提供状況

複数の公開ベンチマークでの評価により、Qwen-Image-Edit は画像編集タスクにおいて最先端(SOTA)性能を達成していることが示されています。モデルは Qwen Chat の「画像編集」機能を通じて利用可能で、重みは GitHub、Hugging Face、ModelScope にホストされています。

Sources