Nari Labs Qwen3-ASR Fast 和 Qwen3-TTS Fast 领跑 Coval 语音 AI 基准测试(2026年9月)

TL;DR – Nari Labs 在 Coval 语音 AI 基准测试中占据主导地位

Nari Labs 的 Qwen3‑ASR FastQwen3‑TTS Fast 模型分别处于语音转文本(STT)和文本转语音(TTS)的质量-延迟帕累托前沿,并且在所有公开列出的模型中,也处于延迟-成本和质量-成本的前沿。


语音转文本性能

结论: Qwen3‑ASR Fast 在 Coval 基准测试中实现了 44 ms 的最低中位时间到最终分段(TTFS),同时保持词错误率(WER)为 3.6%,在延迟方面排名第一,在准确率方面排名第二。

  • 延迟: p50 TTFS = 44 ms,是 Coval STT 排行榜中报告的最低值。
  • 准确率: WER = 3.6%,仅比 AssemblyAI 的 Universal 3.5 Pro(WER = 3.5 %)高出 0.1 %。
  • 成本: Fast 端点为 $0.12 / 小时,与所有公布费率的模型中并列第二低。Standard 端点更便宜,为 $0.06 / 小时。
  • 竞争性定价: AssemblyAI 的 Universal 3.5 Pro 成本高 3.75 倍;Deepgram Nova 3 成本高 2.4 倍。

“我们的 Qwen3‑ASR Fast 模型在时间到最终分段(TTFS)方面排名第一,p50 为 44 ms,WER 为 3.6%,在准确率上仅次于 AssemblyAI 的 Universal 3.5 Pro(3.5%)。” – Nari Labs 博客

文本转语音性能

结论: Qwen3‑TTS Fast 实现了第二快的中位时间到首个音频(TTFA)为 63 ms,同时在 WER 上达到最佳的 3.8%,在成本更低的情况下超越了更大的商业服务。

  • 延迟: p50 TTFA = 63 ms,仅次于 Fluxions 的 vui(49 ms),后者使用的是 300 M 参数模型。
  • 准确率: WER = 3.8%,是所有评估模型中最低的。
  • 成本: $10 / 100 万字符,与 Coval 定价目录中并列最便宜。Standard 端点为 $5 / 100 万字符。
  • 竞争性定价: ElevenLabs Eleven v3 Conversational 成本约为其 5 倍;Cartesia Sonic 3.6 成本约为其 6.5 倍。
  • 模型规模: Qwen3‑TTS Fast 运行的是 1.7 B 参数模型,在质量-延迟方面优于 300 M 参数的 vui

“我们的 Qwen3‑TTS Fast 模型在时间到首个音频(TTFA)方面排名第二,p50 为 63 ms,WER 为 3.8%,位居第一。” – Nari Labs 博客

全面的成本效益

结论: Nari Labs 在延迟-成本和质量-成本帕累托前沿上领先,意味着在所有公开记录的服务中,您能以最低价格获得最快、最准确的 STT/TTS。

  • STT: $0.12 / 小时(Fast)对比 AssemblyAI 类似产品 $0.45 / 小时。
  • TTS: $10 / 100 万字符(Fast)对比 ElevenLabs 和 Cartesia 的 $50‑$65 / 100 万字符。
  • 定价方法: 比较基于 Coval 的定价目录,该目录汇总了每个端点的已知公开费率。

Hacker News 社区反应

结论: 讨论凸显了对实时 TTS 的热情,呼吁独立验证,并对技术捷径充满好奇。

  • 实时可行性: 一位用户(mowmiatlas)分享了一个 GitHub 项目,用于实时 TTS,指出低延迟合成正成为普遍趋势。
  • 竞争格局: iharnoor 警告 TTS 市场将更加拥挤,强调语音模型与 LLM API 在市场动态上的差异。
  • 质量担忧: 一位评论者(rahimnathwani)报告在一段 33 秒的音频中出现语音切换故障,暗示需要进行鲁棒性测试。
  • 验证需求: yoloakki 呼吁独立评估(例如 Datapoint AI)以确认 Nari 的声明。
  • 技术好奇: asaiacai 询问加速 TTS 的主要手段,推测可能是模型蒸馏和架构感知优化。
  • 演示期待: ipsum2 提醒公开声明应包含交互式演示;目前 Nari Labs 提供免费试用期。
  • 开源好奇: meatmanek 询问 ASR 推理引擎是否开源;Nari Labs 尚未公开披露此信息。

基准测试数据对开发者的意义

结论: 对于生产级语音代理,选择 Nari Labs 的 Fast 端点可将感知延迟降低数十毫秒,同时相比主流商业替代方案,运营成本最多降低 75 %。

  • 用户体验: 更低的 TTFA/TTFS 直接转化为对话界面中更快的响应速度,减少终端用户的“思考”间隔。
  • 可扩展性: 低廉的每小时(STT)和每字符(TTS)费率支持大规模部署,而不会产生高昂的云支出。
  • 集成: Nari Labs 提供 RESTful API 并支持免费试用;在服务从测试版转向正式版时,早期采用者可获得 $20 信用额度。

核心要点: Nari Labs 的 Qwen3‑ASR Fast 和 Qwen3‑TTS Fast 设立了语音 AI 延迟、准确率和成本的新行业标准,使其成为开发实时语音应用的极具吸引力的选择。

Sources

相关