OpenAI Whisper 发布
OpenAI 已推出 Whisper,这是一款自动语音识别(ASR)系统,旨在在多种音频环境中实现高度鲁棒性。通过在网络上收集的 680,000 小时多语言、多任务监督数据的大规模数据集上进行训练,Whisper 在背景噪音、各种口音以及专业语言的存在下提升了转录准确性。
架构与技术实现
Whisper 使用简单的端到端编码器-解码器 Transformer 架构。处理流程包括以下步骤:
- 音频处理:将输入音频划分为 30 秒的片段。
- 特征提取:将这些片段转换为对数梅尔频谱图。
- 编码:将频谱图输入编码器。
- 解码:解码器预测相应的文本字幕。
为了在单一模型中处理多任务,Whisper 使用特殊标记。这些标记指示模型执行特定功能,包括语言识别、短语级时间戳、多语言语音转录以及将非英语语音翻译成英语。
性能与鲁棒性
Whisper 的主要优势在于其通用鲁棒性,而非在狭窄、专门基准上的性能。
- 零样本性能:在多样化数据集上测量时,Whisper 显示出显著高于在较小、紧密配对音频-文本数据集上训练的模型的鲁棒性,在零样本场景下错误率降低约 50%。
- 专用基准:由于未针对特定数据集进行微调,Whisper 并未超越专门针对 LibriSpeech 性能进行优化的模型。
- 多语言能力:约三分之一的训练数据为非英语。这使得模型在转录原始语言以及将其翻译成英语方面表现出色。在零样本测试中,Whisper 在 CoVoST2 到英语的翻译任务上超越了监督式最先进(SOTA)水平。
开源可用性
为了支持语音界面的开发以及进一步的鲁棒语音处理研究,OpenAI 已开源 Whisper 模型及其相关推理代码。
Sources
- OriginalIntroducing Whisper