OpenAI Whisper 發布

OpenAI 推出了 Whisper,一個自動語音辨識(ASR)系統,旨在於各種音訊環境中具備高度的魯棒性。透過在來自網路的 68 萬小時多語言與多任務監督資料的大規模資料集上進行訓練,Whisper 能提升在背景噪音、各種口音以及專業術語環境下的轉錄準確度。

架構與技術實作

Whisper 採用簡單的端對端編碼器-解碼器 Transformer 架構。處理流程遵循以下步驟:

  1. 音訊處理:輸入音訊被切分為 30 秒的片段。
  2. 特徵提取:這些片段被轉換為對數梅爾頻譜圖。
  3. 編碼:頻譜圖通過編碼器。
  4. 解碼:解碼器預測相應的文字說明。

為了在單一模型中處理多項任務,Whisper 使用特殊標記(tokens)。這些標記指示模型執行特定功能,包括語言辨識、片語層級時間戳記、多語言語音轉錄,以及將非英語語音翻譯成英語。

效能與魯棒性

Whisper 的主要優勢在於其通用性的魯棒性,而非在狹窄、專門化基準測試上的表現。

  • 零樣本表現:在多樣化資料集上測量時,Whisper 展現出遠高於在較小、緊密配對的音訊-文字資料集上訓練的模型的魯棒性,在零樣本情境下錯誤率降低了 50%。
  • 專門化基準:由於未針對特定資料集進行微調,Whisper 並未超越專門針對 LibriSpeech 表現優化的模型。
  • 多語言能力:約三分之一的訓練資料為非英語。這使模型在轉錄原始語言以及將其翻譯成英語方面皆表現出色。在零樣本測試中,Whisper 在 CoVoST2 至英語的翻譯上超越了監督式的最先進(SOTA)水平。

開源可用性

為了支援語音介面的開發以及進一步的魯棒語音處理研究,OpenAI 已將 Whisper 模型與相關的推論程式碼開源。

Sources