Qwen-Image-3.0 リリースノート

QwenはQwen-Image-3.0をリリースしました。これは第3世代の基礎的な画像生成モデルで、画像生成を単なる美的表現から実用的な生産性ツールへと転換することを目的としています。モデルは「Real」(实)という概念を中心に据えており、豊富なコンテンツ、実物らしいディテール、深い知識という3つの主要技術柱で実現されています。

豊富なコンテンツ: 複雑なレイアウトと高トークン入力

Qwen-Image-3.0は、許容できる指示長さを4.5kトークンに拡大することで、極めて複雑で情報密度の高いビジュアルレイアウトを描画できます。これにより、画像構成において水平拡張と垂直深度の両方を扱うことが可能になります。

水平拡張と空間制御

モデルは高い意味的並置と空間制御を示し、相互干渉なしに単一画像内に複数の異なる概念を配置できます。この機能の例として、3.7kトークンのプロンプトに基づき、各セルに複雑なインフォグラフィック(例:数学記号、生物学の解説、医療図)を含む3×3グリッドを一度の生成で作成することが挙げられます。

垂直深度と論理的ネスト

平行要素にとどまらず、モデルは意味的分解と論理的ネストをサポートします。単一画像内で複数の入れ子インターフェースを層ごとに描画でき、例えばVSCodeインターフェースの中にQwen Chatインターフェースがあり、さらにその中にWeChatインターフェースとコーヒーポスターが含まれるといった構成でも、各UI層の本物らしいスタイルを保持します。

本物らしいディテール: マイクロレベルの精度

Qwen-Image-3.0はマイクロレベルのディテールに対して高い描画精度を実現し、可読性と写真のようなリアリズムに焦点を当てています。

正確なテキスト描画

モデルは10pxまでの小さなテキストを描画でき、密集した環境でも可読性を保ちます。主な機能は以下の通りです:

  • Academic Papers: LaTeX数式、下付き文字、上付き文字、ギリシャ文字、定理番号を正確に描画します。
  • Realistic Documents: 新聞形式で密集したテキストを生成し、実際の新聞の本物らしい外観をシミュレートします。
  • Handwritten Annotations: 下線や矢印を含むリアルな赤い手書きメモを重ね合わせ、学生の授業ノートをシミュレートします。

テクスチャと修復

モデルは毛穴や毛髪の細部を含むリアルな肌テクスチャを生成します。編集作業では、カビの斑点や損傷を除去しつつ、元の芸術様式、墨絵のグラデーション、筆致を保持して、損傷した伝統絵画を修復できます。

深い知識: 多言語と世界認識

モデルは広範な世界知識を活用し、さまざまなスタイルやインターフェースを描画します。

多言語とUIサポート

モデルは12言語をネイティブに描画し、100以上の芸術スタイルをサポートします。ウェブページ、ゲーム、ライブ配信向けの主流ユーザーインターフェースをシミュレートできます。

知識駆動生成

モデルはシンプルな写真を、分類情報、形態学的注釈、スケールバーを追加することで、プロフェッショナルな研究図に変換できます。また、インターネットに接続して最新情報を取得し、特定の日付と場所の天気予報画像を生成したり、特定のIP人物像をシーンに組み込んだりすることも可能です。

Sources