Qwen3.5-LiveTranslate-Flash リリースノート

Qwen は Qwen3.5-Omni アーキテクチャ上に構築された同時通訳モデル Qwen3.5-LiveTranslate-Flash を発表しました。このモデルは音声と映像のコンテキストを統合し、クロスリンガル音声クローンを通じて翻訳精度と話者一貫性を向上させたリアルタイム・マルチモーダル翻訳を実現します。

主な技術アップグレード

Qwen3.5-LiveTranslate-Flash は前世代の Qwen3-LiveTranslate と比較して、言語カバレッジ、レイテンシ、用語処理において大幅な改善をもたらします。

言語サポートの拡張

モデルは言語能力を大幅に拡張しました:

  • 入力音声および出力テキスト: 18 言語から 60 言語へ増加。
  • 出力音声: 10 言語から 29 言語へ増加。

超低レイテンシ – Readable Unit 技術

同時通訳の遅延を最小化するため、モデルは新しい "Readable Unit" リアルタイム翻訳手法を採用しています。この戦略により、意味的一貫性と可読性を保ちつつ、より積極的なストリーミング出力が可能になります。

ベンチマーク結果では、Qwen3.5-LiveTranslate-Flash は前バージョンに比べて first‑token レイテンシを 3.45 秒、トークン単位のレイテンシを 1.88 秒 短縮し、平均的な音声‑to‑音声トークンレイテンシは 2.8 秒となっています。

リアルタイム音声クローン

システムは話者の声質を 1 文から再現でき、翻訳された音声が元の話者と同じ声で異なる言語で話すようにします。この機能は 事前登録、クローン‑ワンス、リアルタイム の 3 つのモードをサポートします。

動的ホットワード強化

固有名詞や業界固有用語の誤訳を減らすため、モデルには組み込みの Hotword 機能が搭載されています。ユーザーはシナリオごとに名前、場所、ブランド名、製品モデルなどをリアルタイムで動的に設定・更新できます。

モデルアーキテクチャ

Qwen3.5-LiveTranslate は Qwen3.5-Omni Thinker‑Talker アーキテクチャを基盤としています:

  • Thinker: 交互に配置された映像と音声入力を処理し、テキスト翻訳を生成します。
  • Talker: 翻訳テキストと元音声を用いて、クロスリンガル音声クローンを伴う音声を生成します。

リアルタイム通訳のため、モデルはチャンク単位のストリーミング入力メカニズムと Readable Unit タグを使用し、音声合成の粒度を制御します。

マルチモーダル機能と活用例

Qwen3.5-LiveTranslate-Flash は映像コンテキストを活用して翻訳の曖昧性を解消し、画面上のテキストやシーン内のオブジェクトを手掛かりに単語やフレーズの正しい意味を選択します。

主な活用シナリオ:

  • 国際会議: コードスイッチや多様なアクセント、ドメイン固有用語をリアルタイムで処理。
  • 旅行: AI グラスと連携し、メニューなどの視覚情報と音声対話を組み合わせたオンデバイス翻訳を実現。
  • ライブ配信: 商品仕様や数値データの正確な翻訳で e コマースローカリゼーションを支援。
  • 文学翻訳: 三国志演義 の古典中国語(文言文)などの古文を現代英語へ翻訳する際にも活用可能。

DashScope API を用いた実装

モデルは WebSocket 接続 (wss://dashscope.aliyuncs.com/api-ws/v1/realtime) を介した DashScope API で利用できます。API の主な機能は以下の通りです:

  • モダリティ: テキストと音声の両方、またはテキストのみの出力を設定可能。
  • 入力: PCM 音声チャンクと映像フレーム(視覚コンテキスト)を受け取ります。
  • カスタマイズ: corpus フィールドでホットワードを登録し、特定フレーズの精度を向上させます。

今後の開発方向性

Qwen は以下の点に注力し、モデルのさらなる進化を目指します:

  • エンドツーエンドレイテンシをさらに削減し、リアルタイム限界に近づける。
  • 低リソース言語や地域方言のカバレッジを拡大。
  • 長文対話における用語や名前の一貫性を向上。
  • 環境音や現場の雰囲気を含む音声クローンの忠実度を強化。
  • ジェスチャー、口の動き、表情を統合したマルチモーダル共同モデリングを実装。

Sources