Nari Labs Qwen3-ASR Fast 與 Qwen3-TTS Fast 領先 Coval 語音 AI 基準測試(2026 年 9 月)
簡要重點 – Nari Labs 在 Coval 語音 AI 基準測試中佔據主導地位
Nari Labs 的 Qwen3‑ASR Fast 與 Qwen3‑TTS Fast 模型分別在語音轉文字(STT)與文字轉語音(TTS)領域處於品質-延遲的帕累托前緣,同時在所有公開模型中也位於延遲-成本與品質-成本的前緣。
語音轉文字效能
結論: Qwen3‑ASR Fast 在 Coval 基準測試中以 44 ms 的中位數最終片段時間(TTFS)達成最快延遲,同時維持 3.6% 的詞錯誤率(WER),在延遲方面排名 #1,在準確性方面排名 #2。
- 延遲: p50 TTFS = 44 ms,為 Coval STT 排行榜中報告的最低值。
- 準確性: WER = 3.6%,僅比 AssemblyAI 的 Universal 3.5 Pro(WER = 3.5 %)高出 0.1 %。
- 成本: Fast 端點每小時 $0.12,與公開定價模型中第二低的價格並列;Standard 端點更便宜,僅需 $0.06 / 小時。
- 競爭性定價: AssemblyAI 的 Universal 3.5 Pro 價格高 3.75 倍;Deepgram Nova 3 價格高 2.4 倍。
「我們的 Qwen3‑ASR Fast 模型在 Time‑to‑Final‑Segment(TTFS)上排名 #1,p50 為 44 ms,WER 為 3.6%,僅次於 AssemblyAI 的 Universal 3.5 Pro(3.5%)位居第二。」 – Nari Labs 博客
文字轉語音效能
結論: Qwen3‑TTS Fast 以 63 ms 的中位數首段音訊時間(TTFA)達成第二快延遲,並以 3.8% 的最低 WER 獲得最佳準確性,表現超越更大規模的商業服務,且成本更低。
- 延遲: p50 TTFA = 63 ms,僅次於 Fluxions 的 vui(49 ms),後者使用 300 M 參數模型。
- 準確性: WER = 3.8%,為所有評估模型中最低。
- 成本: $10 / 1M 字元,與 Coval 定價目錄中最低價格並列;Standard 端點為 $5 / 1M 字元。
- 競爭性定價: ElevenLabs Eleven v3 Conversational 價格約高 5 倍;Cartesia Sonic 3.6 價格約高 6.5 倍。
- 模型規模: Qwen3‑TTS Fast 執行 1.7 B 參數模型,提供比 300 M 參數的 vui 更佳的品質-延遲表現。
「我們的 Qwen3‑TTS Fast 模型在 Time‑to‑First‑Audio(TTFA)上排名 #2,p50 為 63 ms,WER 為 3.8%,位居第一。」 – Nari Labs 博客
全面的效能成本比
結論: Nari Labs 在延遲-成本與品質-成本的帕累托前緣領先,表示在所有公開記錄的服務中,您能以最低價格獲得最快、最準確的 STT/TTS。
- STT: $0.12 / 小時(Fast)對比 AssemblyAI 相似產品的 $0.45 / 小時。
- TTS: $10 / 1M 字元(Fast)對比 ElevenLabs 與 Cartesia 的 $50‑$65 / 1M 字元。
- 定價方法論: 比較基於 Coval 的定價目錄,該目錄整合了各端點的公開定價資訊。
社群在 Hacker News 上的反應
結論: 討論聚焦於即時 TTS 的可行性、呼籲獨立驗證,以及對技術捷徑的好奇。
- 即時可行性: 一位使用者(mowmiatlas)分享了一個 GitHub 專案,展示即時 TTS,指出低延遲合成趨勢正日益普及。
- 競爭格局: iharnoor 警告 TTS 市場將更加擁擠,強調語音模型與 LLM API 在市場動態上有所不同。
- 品質疑慮: 一位評論者(rahimnathwani)報告在一段 33 秒的音訊中出現語音切換錯誤,暗示需進行更嚴謹的韌性測試。
- 驗證需求: yoloakki 呼籲獨立評估(例如 Datapoint AI)以確認 Nari 的聲稱。
- 技術好奇: asaiacai 詢問加速 TTS 的主要關鍵因素,假設包括模型蒸餾與架構感知優化。
- 示範期待: ipsum2 提醒公開宣告應搭配互動式示範;Nari Labs 目前提供免費試用期。
- 開源好奇: meatmanek 詢問 ASR 推論引擎是否開源;Nari Labs 尚未公開此資訊。
基準數字對開發者的意義
結論: 對於生產環境中的語音代理,選擇 Nari Labs 的 Fast 端點可將感知延遲降低數十毫秒,同時相比領先的商業替代方案,營運成本可降低高達 75 %。
- 使用者體驗: 更低的 TTFA/TTFS 直接轉化為對話介面中更快的回應速度,減少使用者的「思考」空窗期。
- 可擴展性: 廉價的每小時(STT)與每字元(TTS)定價,使高頻率部署成為可能,且不會造成雲端支出過高。
- 整合: Nari Labs 提供 RESTful API,並提供免費試用;在服務從測試版轉為正式版時,早期採用者可獲得 $20 信用額度。
重點: Nari Labs 的 Qwen3‑ASR Fast 與 Qwen3‑TTS Fast 在語音 AI 延遲、準確性與成本方面設立了新產業標準,使其成為開發即時語音應用程式開發者極具吸引力的選擇。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch