Nari Labs Qwen3-ASR Fast と Qwen3-TTS Fast が Coval 音声AIベンチマークで首位を獲得(2026年9月)
まとめ – Nari LabsがCovalの音声AIベンチマークを独占
Nari LabsのQwen3‑ASR FastとQwen3‑TTS Fastモデルは、それぞれ音声認識(STT)およびテキスト音声変換(TTS)において、品質と遅延のパレートフロンティアを占めており、公開されているすべてのモデルの中で遅延とコスト、品質とコストのフロンティアにも位置しています。
音声認識性能
結論: Qwen3‑ASR Fastは、44 msの中央値の最終セグメントまでの時間(TTFS)で最も速く、単語誤り率(WER)を3.6%に維持し、Covalのベンチマークで遅延面で1位、精度面で2位を獲得しています。
- 遅延: p50 TTFS = 44 ms、Coval STTランキングで報告された最低値。
- 精度: WER = 3.6%、AssemblyAIのUniversal 3.5 Pro(WER = 3.5 %)よりわずか0.1 %高いのみ。
- コスト: Fastエンドポイントは1時間あたり$0.12、公開価格を持つモデルの中では2番目に安い。Standardエンドポイントはさらに安価で$0.06 / 時間。
- 競争力のある価格: AssemblyAIのUniversal 3.5 Proは3.75倍、Deepgram Nova 3は2.4倍高い。
「私たちのQwen3‑ASR Fastモデルは、p50が44 ms、WERが3.6%で、Time‑to‑Final‑Segment(TTFS)で1位にランクインしており、AssemblyAIのUniversal 3.5 Pro(3.5%)に次ぐ2位です。」 – Nari Labsブログ
テキスト音声変換性能
結論: Qwen3‑TTS Fastは、63 msの中央値の最初の音声までの時間(TTFA)で2位を達成し、WERは3.8%で最低を記録。より大きな商用サービスを上回りながらも、コストは低く抑えられています。
- 遅延: p50 TTFA = 63 ms、300 Mパラメータモデルを使用するFluxionsのvui(49 ms)に次ぐ2位。
- 精度: WER = 3.8%、評価されたすべてのモデルの中で最低。
- コスト: 100万文字あたり$10、Covalの価格目録で最も安い価格と並ぶ。Standardエンドポイントは50万文字あたり$5。
- 競争力のある価格: ElevenLabs Eleven v3 Conversationalは約5倍、Cartesia Sonic 3.6は約6.5倍高い。
- モデルサイズ: Qwen3‑TTS Fastは17億パラメータモデルを実行しており、300 Mパラメータのvuiよりも優れた品質と遅延のバランスを実現しています。
「私たちのQwen3‑TTS Fastモデルは、p50が63 ms、WERが3.8%で、Time‑to‑First‑Audio(TTFA)で2位にランクインし、精度面では1位です。」 – Nari Labsブログ
すべての面で高いコスト効率
結論: Nari Labsは遅延-コストおよび品質-コストのパレートフロンティアをリードしており、公開されているサービスの中で最も速く、最も正確なSTT/TTSを、最も低い価格で提供しています。
- STT: Fastは1時間あたり$0.12、AssemblyAIの同等サービスの$0.45と比較。
- TTS: Fastは100万文字あたり$10、ElevenLabsやCartesiaの$50–$65と比較。
- 価格算出方法: 比較はCovalの価格目録を使用しており、各エンドポイントの既知の公開価格を集計しています。
Hacker Newsでのコミュニティの反応
結論: 議論はリアルタイムTTSへの関心、独立した検証の要請、技術的な裏技への好奇心を浮き彫りにしています。
- リアルタイムの可能性: ユーザー(mowmiatlas)はリアルタイムTTS用のGitHubプロジェクトを共有し、低遅延合成の普及傾向を指摘。
- 競争状況: iharnoorはTTS市場がさらに混雑する可能性を警告し、音声モデルがLLM APIと異なる市場動向を持つことを強調。
- 品質への懸念: コメント(rahimnathwani)は33秒のクリップで音声切り替えのバグを報告し、耐障害性のテストの必要性を示唆。
- 検証の要請: yoloakkiはDatapoint AIなどの独立した評価を求めており、Nariの主張の検証を促進。
- 技術への関心: asaiacaiはTTSの高速化の主な要因について尋ね、モデルの蒸留やアーキテクチャに配慮した最適化を仮説。
- デモの期待: ipsum2は公開発表にはインタラクティブなデモが有益であると指摘。Nari Labsは現在、無料トライアル期間を提供中。
- オープンソースへの関心: meatmanekはASR推論エンジンがオープンソースかどうかを尋ねたが、Nari Labsはこれについて公に明かしていない。
ベンチマーク数値が開発者に与える意味
結論: 本番環境の音声エージェント開発において、Nari LabsのFastエンドポイントを選択することで、ユーザーの認識遅延を数十ミリ秒短縮しつつ、主要な商用代替品と比較して運用コストを最大75%削減できます。
- ユーザー体験: 低いTTFA/TTFSは、対話インターフェースでの応答速度を直接向上させ、エンドユーザーの「思考のギャップ」を短縮。
- スケーラビリティ: 低コストの時間単位(STT)および文字単位(TTS)の料金は、高負荷の展開を制約のないクラウドコストで可能に。
- 統合: Nari Labsは無料トライアル付きのRESTful APIを提供。ベータからGAへの移行に際して、早期導入者には20ドルのクレジットが提供される。
結論: Nari LabsのQwen3‑ASR FastとQwen3‑TTS Fastは、音声AIの遅延、精度、コストにおいて新しい業界基準を設定し、リアルタイム音声アプリケーションを開発する開発者にとって魅力的な選択肢となっています。
Sources
関連
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch