Granite Speech 5.0 Turbo CTC 發佈說明 / 新功能
Hugging Face 與 IBM 已發佈 Granite Speech 5.0 Turbo CTC,這是一對擁有 470M 參數的英文語音辨識模型,旨在實現極速與高準確度。這些模型在 NVIDIA H200 GPU 上可達到超過 12,600 RTFx 的吞吐量,透過批次推論,能夠在單秒內轉錄超過 3.5 小時的語音。
模型變體與授權
提供兩個版本的模型以滿足不同的授權與數據需求:
granite-speech-5.0-470m-turboctc: 一個使用 Apache 2.0 授權的模型,是在較小的數據集上訓練而成。granite-speech-5.0-470m-turboctc-nc: 一個非商業用途模型,採用 CC-BY-NC-SA-4.0 授權,透過額外數據訓練以提升準確度。
性能與基準測試
根據 OpenASR Leaderboard 公開英文短篇測試集的非官方結果,這兩個模型都展現了高準確度與前所未有的吞吐量:
- 準確度: 非商業 (NC) 模型達到了 4.85% 的總字錯誤率 (WER),而 Apache 2.0 模型的分數為 5.00% WER。
- 吞吐量: 兩個模型都超過了 12,600 RTFx。
- 比較性能: NC 模型在大多數測試集中通常優於 Apache 2.0 模型,在 SPGI Speech 上展現出顯著優勢,儘管在分段式的 Earnings22 測試中表現較差。
在截至 2026 年 8 月 25 日的 FFASR Leaderboard 官方結果中,granite-speech-5.0-470m-turboctc-nc 模型在準確度排名第五,而 granite-speech-5.0-470m-turboctc 排名第九,兩者皆為排行榜上速度最快的模型。
模型架構
Granite Speech 5.0 Turbo CTC 採用僅編碼器 (encoder-only) 架構,與先前使用聲學編碼器搭配投影器 (projector) 以及帶有 LoRA 適配器的 Granite LM 不同以往的 Granite Speech 模型不同。這種設計將記憶體占用降低至 470M 參數,並與先前版本相比將吞吐量提升了 20 倍以上。
技術規格
- 結構: 由 16 個 Conformer 區塊堆疊而成。
- 優化: 訓練期間使用 Connectionist Temporal Classification (CTC) 損失函數。
- 注意力機制: 採用分塊注意力 (chunkwise attention) 以防止隨序列長度呈二次方增長。
- 自我條件化 (Self-Conditioning): 在第 8 個區塊的輸出端實作。
時間下採樣 (Temporal Subsampling)
為了將 Token 速率從每秒 100 幀 (log Mel spectrogram 前端) 降低至每秒 12.5 個 Token,模型採用了三個階段的 2x 下採樣:
- 第一階段: 透過
reshape()操作將連續的 log Mel 特徵向量堆疊起來。 - 第二與第三階段: 於前兩個 Conformer 區塊中整合,使用步進卷積 (strided convolutions) 進行時間下採樣。
Tokenization
模型的 Token 速率比先前的編碼器更低。granite-speech-5.0-470m-turboctc-nc 模型使用 SentencePiece tokenization,而 granite-speech-5.0-470m-turboctc 模型使用 BPE tokenization。這兩種 tokenizer 都是專門針對語音轉錄文本進行訓練的。
訓練數據
訓練過程結合了自然與合成數據集。兩個模型皆是在以下自然數據集上進行訓練的:
| Dataset | Hours | Source | | :--- | :--- | :--- | | | MLS | 44,600 | Multilingual LibriSpeech | | YODAS | 8,900 | ESPnet YODAS | | CommonVoice-17 | 2,500 | Mozilla Common Voice 17.0 | | Librispeech | 960 | OpenSLR LibriSpeech ASR | | VoxPopuli | 500 | Facebook VoxPopuli | | AMI | 150 | Edinburgh CSTR AMI | | Earnings-22 | 100 | ESB Datasets |
非商業 (NC) 模型在 GigaSpeech (10,000 小時) 與 SPGI Speech (4,900 小時) 上接受了額外訓練。
此外,兩個模型皆是在三個合成數據集上進行訓練的:
- 多說話者串聯 (General): 由 MLS, YODAS, CommonVoice-17, VoxPopuli, 與 AMI 生成的 2,000 小時數據。
- 多說話者串聯 (Earnings-22): 由 Earnings-22 生成的 500 小時數據。
- 目標語句 (Targeted Utterances): 透過
gpt-oss-120b或gpt-oss-20b生成的 240 小時數字、貨幣與地址數據,並使用StyleTTS2進行合成。
使用與實作
Granite Speech 5.0 Turbo CTC 在 transformers 函式庫中獲得原生支援。使用者可以透過 Hugging Face 生態系統中的 AutoModelForCTC 與 AutoProcessor 來實作該模型。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- 專案
- Dispatch