Qwen VLo: 統合マルチモーダル理解と生成

Qwen VLo は、視覚的知覚と創造的生成のギャップを埋めることを目的とした統合マルチモーダルモデルです。従来の主に理解に焦点を当てたモデルとは異なり、Qwen VLo は世界を「理解」し、その理解に基づいて高品質な再現を生成できるため、ユーザーは単一インターフェース内で分析から創作へと移行できます。

統合マルチモーダル機能

Qwen VLo は、マルチモーダルの理解と生成を単一フレームワークに統合し、テキストと画像間の双方向フローを実現します。モデルは主に以下の 3 つの操作モードをサポートします。

1. オープンエンド画像編集と再創造

Qwen VLo は自然言語による指示ベースの編集をサポートします。これにより、ユーザーは既存画像に対して複雑な変更を行いながら、意味的な一貫性と構造的な整合性を保つことができます。主な機能は次のとおりです。

  • スタイル転送: 画像を特定の芸術スタイル(例: Ghibli、One Piece、Dragon Ball、Pixar 3D)に変換します。
  • オブジェクト修正: オブジェクトの追加、削除、置換(例: スイカをドリアンに置き換える、犬に赤い帽子を付ける)を行います。
  • シーン再構築: 背景の変更(例: 部屋からエッフェル塔へ被写体を移動)や全体的な雰囲気の変更を行います。
  • 複合指示: レイアウト、配色、手書き文字など特定の要件を含むプロモーションポスターの作成など、単一コマンドで複数ステップのタスクを実行します。

2. テキストから画像への生成

編集に加えて、モデルはテキストプロンプトから全く新しい画像を生成できます。中国語と英語のバイリンガル指示に対応し、リアルな写真や 3D レンダリングから伝統的な水墨画、タイポグラフィアートまで幅広い出力を生成します。

3. 視覚的知覚とローカリゼーション

Qwen VLo は強力な理解能力を保持しており、シンプルな編集指示を通じて従来のコンピュータビジョンタスクを実行できます。

  • 検出とセグメンテーション: 検出ボックスやセグメンテーションマスクを生成(例: 赤いマスクでバナナをセグメント)します。
  • エッジ検出: 画像のエッジ検出マップを予測します。
  • 自己分析: 生成した画像を再解析し、たとえば生成した犬や猫の品種を特定するといった詳細情報を抽出します。

技術実装とメカニズム

Qwen VLo は出力の柔軟性と制御性を高めるために、特定のアーキテクチャ選択を採用しています。

段階的生成プロセス

Qwen VLo は、画像を上から下へ、左から右へと段階的に構築する生成メカニズムを使用します。このアプローチは生成効率を向上させ、長文テキストや漫画パネルのような複雑なレイアウトタスクに対してより細かな制御を可能にします。

動的解像度サポート

動的解像度トレーニングにより、モデルは任意の解像度とアスペクト比の入力・出力画像をサポートします。固定フォーマットの制約がなくなり、ウェブバナーやソーシャルメディアカバーに適した 4:1 や 1:3 といった長方形フォーマットの作成が可能です。

現在の制限と今後の方向性

プレビュー版として、Qwen VLo にはいくつかの課題があります。

  • 安定性: 元画像との不一致や指示への不遵守といった不正確さや一貫性の欠如が発生する場合があります。
  • 意図認識: 生成画像の背後にある意図を安定して認識できないことがあります。

今後、Qwen チームは生成能力を活用して理解を監督・洗練させることを目指します。セグメンテーションや検出マップといった中間結果を生成させることで、モデルは自身の視覚的理解を検証し、全体的なパフォーマンスをさらに向上させることが可能になります。

Sources