Qwen3-ASR と Qwen3-ForcedAligner のリリース
Qwen は Qwen3-ASR と Qwen3-ForcedAligner のモデルファミリーをオープンソース化し、高性能で多言語対応の音声認識と正確なタイムスタンプアラインメントツールを提供します。これらのモデルは Qwen3-Omni 基盤モデルの音声理解能力を活用し、数十の言語と方言にわたって堅牢な文字起こしとアラインメントを実現します。
Qwen3-ASR: 多言語音声認識
Qwen3-ASR は Qwen3-ASR-1.7B と Qwen3-ASR-0.6B の 2 つのオールインワンモデルで構成され、言語識別と自動音声認識 (ASR) を単一パイプラインに統合しています。
主な機能と対応言語
両モデルは 30 種類の言語と 22 種類の中国語方言に対応し、各国・地域の英語アクセントも含みます。対応言語は中国語 (zh)、英語 (en)、広東語 (yue)、アラビア語 (ar)、ドイツ語 (de)、フランス語 (fr)、スペイン語 (es)、ポルトガル語 (pt)、インドネシア語 (id)、イタリア語 (it)、韓国語 (ko)、ロシア語 (ru)、タイ語 (th)、ベトナム語 (vi)、日本語 (ja)、トルコ語 (tr)、ヒンディー語 (hi)、マレー語 (ms)、オランダ語 (nl)、スウェーデン語 (sv)、デンマーク語 (da)、フィンランド語 (fi)、ポーランド語 (pl)、チェコ語 (cs)、フィリピン語 (fil)、ペルシア語 (fa)、ギリシャ語 (el)、ハンガリー語 (hu)、マケドニア語 (mk)、ルーマニア語 (ro) です。
パフォーマンスとベンチマーク
Qwen3-ASR-1.7B はハイパフォーマンス版として位置付けられ、オープンソース ASR モデルの中で最先端 (SOTA) の結果を達成し、商用のプロプライエタリ API とも競合します。
- 英語: 16 カ国のアクセントを含む社内テストセットにおいて、GPT-4o Transcribe、Gemini 系列、Doubao ASR、Whisper-large-v3 を上回ります。
- 多言語: 20 の主要言語で既存のオープンソースモデルを上回り、平均 Word Error Rate (WER) が最良です。
- 中国語と方言: 標準中国語、広東語、22 の地域方言において、商用 API とオープンソースモデルの両方をリードします。
- ロバスト性: 子供や高齢者の音声、極低 SNR 環境などの困難なシナリオでも低い文字/単語エラー率を維持します。
- 歌声: 背景音楽 (BGM) がある中国語と英語のフルソング文字起こしに対応し、平均 WER は中国語で 13.91%、英語で 14.60% です。
効率とスループット
Qwen3-ASR-0.6B は精度と効率のトレードオフを最適化しています。オンライン非同期モードで同時実行数 128 の場合、2,000 秒の音声を 1 秒で文字起こしでき(5 時間分の音声に相当)、ファーストトークンまでの時間は最短 92 ms です。
Qwen3-ForcedAligner: 正確なタイムスタンプ予測
Qwen3-ForcedAligner-0.6B は、テキストと音声のペアをアラインするために設計された非自己回帰 (NAR) LLM ベースのタイムスタンプ予測器です。
技術仕様
- 言語サポート: 11 言語に対応。
- 容量: 最大 5 分間の音声に対して任意の単位のタイムスタンプを予測可能。
- パフォーマンス: Nemo-Forced-Aligner、WhisperX、Monotonic-Aligner などのエンドツーエンド型強制アラインメントモデルを、タイムスタンプ精度、言語カバレッジ、対応音声長の面で上回ります。
デプロイとフレームワーク
コミュニティでの採用を促進するため、Qwen は Apache 2.0 ライセンス下で包括的な推論・ファインチューニングフレームワークを公開しました。このツールキットは以下をサポートします。
- vLLM ベースのバッチ推論
- 非同期サービング
- ストリーミング推論
- タイムスタンプ予測
- 単一モデルでのオフラインとストリーミング推論の統合
- 最大 20 分の長音声ファイルの文字起こし