Apple SpeechAnalyzer 基准测试:性能对比 Whisper 与 SFSpeechRecognizer

Apple SpeechAnalyzer 在本地英文转录中优于 Whisper Small 与传统 API

Apple 新推出的 SpeechAnalyzer API 是在所有测试中对英文最准确的本地语音引擎, 在清晰和嘈杂的音频环境中均超越 Whisper Small,且运行速度约快三倍。它相较于前代的 SFSpeechRecognizer 也有巨大的提升,后者在所有测试数据集上的词错误率(WER)显著更高。

性能基准

在 Apple M2 Pro(32GB,macOS 26.5.1)上使用 LibriSpeech 数据集进行的测试显示,SpeechAnalyzer 提供了最低的词错误率(WER),数值越低表示准确度越高。

引擎 test-clean WER test-other WER 模型大小
Apple SpeechAnalyzer (iOS/macOS 26) 2.12% 4.56% system
Whisper Small (WhisperKit CoreML) 3.74% 7.95% ~460MB
Whisper Base 5.42% 12.51% ~140MB
Whisper Tiny 7.88% 17.04% ~40MB
Apple SFSpeechRecognizer (legacy) 9.02% 16.25% system

从 SFSpeechRecognizer 迁移到 SpeechAnalyzer

开发者应立即将旧的 SFSpeechRecognizer 迁移到 SpeechAnalyzer。新 API 在相同音频上将词错误率降低了 3.5 到 4 倍。具体而言,干净语音的 WER 从 9.02% 降至 2.12%,嘈杂语音的 WER 从 16.25% 降至 4.56%。除了原始准确度外,SpeechAnalyzer 还能生成更优的标点和大小写文本,相较于旧引擎的粗糙输出有明显提升。

SpeechAnalyzer 与 OpenAI Whisper 对比

在当前 Apple 硬件上进行英文转录时,SpeechAnalyzer 已成为最强的本地选项,以舒适的优势击败 Whisper Small,并且每秒音频所需的计算时间仅为其三分之一。

尽管如此,Whisper 仍保有两个主要优势:

  1. 语言支持: Whisper 覆盖的语言显著更多,而 SpeechTranscriber 支持约 30 种语言环境。
  2. 平台无关性: Whisper 可在多种平台上运行,而 SpeechAnalyzer 仅限运行在运行 OS 26 的 Apple 平台上。

速度与效率

所有测试的引擎在 M2 Pro 上均实现了实时以上的运行速度,转录速度在 12 倍到 40 倍之间。SpeechAnalyzer 的每秒音频转录速度约比 Whisper Small 快 3 倍。

技术方法与验证

  • 可复现性: Whisper 的结果与 OpenAI 在 LibriSpeech 上公布的数字进行对比,显示出一个一致且略高的正向偏差,归因于 CoreML 量化和更严格的文本规范化器。
  • 生产代码路径: 引擎通过实际生产代码运行,而非实验室测试框架,以模拟真实使用场景。
  • 文本规范化: 所有输出均经过规范化(大小写、标点、数字转文字),确保引擎不会因格式问题被扣分。
  • 本地验证: 测试框架被配置为在回退到云识别时拒绝执行,确保所有结果严格在设备上完成。

开发者与用户洞察

社区反馈和开发者报告突出了 SpeechAnalyzer API 的若干实际优势与局限性:

  • 流式能力: 与许多需要完整录音后才能转录的模型不同,SpeechAnalyzer 支持流式处理,用户可以实时看到结果。
  • 应用包体积: 由于模型是系统的一部分,开发者无需在应用中捆绑模型,从而减小最终应用体积。
  • 语言管理: API 将语言视为按需资源,这节省了磁盘空间,但需要为每种语言单独下载模型,使得在未预先知道语言种类的多语言音频转录变得更困难。
  • 与更大模型的比较: 部分用户报告,虽然 SpeechAnalyzer 更快,但像 Whisper Large‑V2 这样的更大模型在某些专业场景(如数学讲座)仍可能略微更准确。

“SpeechAnalyzer 几乎总能正确处理各种音频。它在专有名词上可能会有困难,但会返回发音相似的内容。我主要的抱怨是它每种语言都需要单独下载模型。”

研究的局限性

  • 语言范围: 基准仅限于英文,未考虑 Whisper 支持的 100 多种语言。
  • 音频类型: LibriSpeech 语料库由朗读的有声书语音组成,可能与带口音、远场或多说话人会议环境中的表现不同。
  • 硬件: 结果仅在单台 M2 Pro 机器上生成,虽然准确性在 Apple Silicon 上应保持一致,但速度会因芯片而异。

Sources

相关

  • 项目
  • 项目
  • Dispatch
  • Dispatch
  • Dispatch