Apple SpeechAnalyzer 基准测试:性能对比 Whisper 与 SFSpeechRecognizer
Apple SpeechAnalyzer 在本地英文转录中优于 Whisper Small 与传统 API
Apple 新推出的 SpeechAnalyzer API 是在所有测试中对英文最准确的本地语音引擎, 在清晰和嘈杂的音频环境中均超越 Whisper Small,且运行速度约快三倍。它相较于前代的 SFSpeechRecognizer 也有巨大的提升,后者在所有测试数据集上的词错误率(WER)显著更高。
性能基准
在 Apple M2 Pro(32GB,macOS 26.5.1)上使用 LibriSpeech 数据集进行的测试显示,SpeechAnalyzer 提供了最低的词错误率(WER),数值越低表示准确度越高。
| 引擎 | test-clean WER | test-other WER | 模型大小 |
|---|---|---|---|
| Apple SpeechAnalyzer (iOS/macOS 26) | 2.12% | 4.56% | system |
| Whisper Small (WhisperKit CoreML) | 3.74% | 7.95% | ~460MB |
| Whisper Base | 5.42% | 12.51% | ~140MB |
| Whisper Tiny | 7.88% | 17.04% | ~40MB |
| Apple SFSpeechRecognizer (legacy) | 9.02% | 16.25% | system |
从 SFSpeechRecognizer 迁移到 SpeechAnalyzer
开发者应立即将旧的 SFSpeechRecognizer 迁移到 SpeechAnalyzer。新 API 在相同音频上将词错误率降低了 3.5 到 4 倍。具体而言,干净语音的 WER 从 9.02% 降至 2.12%,嘈杂语音的 WER 从 16.25% 降至 4.56%。除了原始准确度外,SpeechAnalyzer 还能生成更优的标点和大小写文本,相较于旧引擎的粗糙输出有明显提升。
SpeechAnalyzer 与 OpenAI Whisper 对比
在当前 Apple 硬件上进行英文转录时,SpeechAnalyzer 已成为最强的本地选项,以舒适的优势击败 Whisper Small,并且每秒音频所需的计算时间仅为其三分之一。
尽管如此,Whisper 仍保有两个主要优势:
- 语言支持: Whisper 覆盖的语言显著更多,而 SpeechTranscriber 支持约 30 种语言环境。
- 平台无关性: Whisper 可在多种平台上运行,而 SpeechAnalyzer 仅限运行在运行 OS 26 的 Apple 平台上。
速度与效率
所有测试的引擎在 M2 Pro 上均实现了实时以上的运行速度,转录速度在 12 倍到 40 倍之间。SpeechAnalyzer 的每秒音频转录速度约比 Whisper Small 快 3 倍。
技术方法与验证
- 可复现性: Whisper 的结果与 OpenAI 在 LibriSpeech 上公布的数字进行对比,显示出一个一致且略高的正向偏差,归因于 CoreML 量化和更严格的文本规范化器。
- 生产代码路径: 引擎通过实际生产代码运行,而非实验室测试框架,以模拟真实使用场景。
- 文本规范化: 所有输出均经过规范化(大小写、标点、数字转文字),确保引擎不会因格式问题被扣分。
- 本地验证: 测试框架被配置为在回退到云识别时拒绝执行,确保所有结果严格在设备上完成。
开发者与用户洞察
社区反馈和开发者报告突出了 SpeechAnalyzer API 的若干实际优势与局限性:
- 流式能力: 与许多需要完整录音后才能转录的模型不同,SpeechAnalyzer 支持流式处理,用户可以实时看到结果。
- 应用包体积: 由于模型是系统的一部分,开发者无需在应用中捆绑模型,从而减小最终应用体积。
- 语言管理: API 将语言视为按需资源,这节省了磁盘空间,但需要为每种语言单独下载模型,使得在未预先知道语言种类的多语言音频转录变得更困难。
- 与更大模型的比较: 部分用户报告,虽然 SpeechAnalyzer 更快,但像 Whisper Large‑V2 这样的更大模型在某些专业场景(如数学讲座)仍可能略微更准确。
“SpeechAnalyzer 几乎总能正确处理各种音频。它在专有名词上可能会有困难,但会返回发音相似的内容。我主要的抱怨是它每种语言都需要单独下载模型。”
研究的局限性
- 语言范围: 基准仅限于英文,未考虑 Whisper 支持的 100 多种语言。
- 音频类型: LibriSpeech 语料库由朗读的有声书语音组成,可能与带口音、远场或多说话人会议环境中的表现不同。
- 硬件: 结果仅在单台 M2 Pro 机器上生成,虽然准确性在 Apple Silicon 上应保持一致,但速度会因芯片而异。
Sources
相关
- 项目
- 项目
- Dispatch
- Dispatch
- Dispatch