Hugging Face 推理端點:快速 Whisper 轉錄

Hugging Face 在推理端點上推出了全新的 OpenAI Whisper 部署選項,提供相較於先前版本高達 8 倍的效能提升。此更新讓使用者能以社群為中心的方式,利用開源最佳化,部署專屬且具成本效益的轉錄模型。

最佳化推理堆疊

全新的 Whisper 端點由 vLLM 專案提供支援,能在各種硬體平台上有效執行模型,特別針對具備 8.9 或更高運算能力(Ada Lovelace)的 NVIDIA GPU,例如 L4 與 L40s。

為了達成這些效能提升,堆疊採用了三項主要的軟體最佳化:

  • PyTorch 編譯 (torch.compile): 以即時 (JIT) 方式產生最佳化的核心,允許系統修改計算圖並重新排序操作。
  • CUDA 圖形(CUDA Graphs): 透過記錄連續操作並將其分組為較大的工作單元,減少 GPU 排程開銷、資料移動與同步。
  • Float8 KV 快取(Float8 KV Cache): 動態量化激活以降低記憶體需求。雖然計算使用 bfloat16(半精度)進行,但輸出儲存為 float8(1 位元組相較於 bfloat16 的 2 位元組),透過在 KV 快取中儲存更多元素提升快取命中率。

效能基準測試

評估在單一 L4 GPU 上使用 bfloat16 進行,並保持語言、光束大小與批次大小的解碼設定一致。基準測試聚焦於三個模型:Whisper Large V3、Whisper Large V3‑Turbo 與 Distil‑Whisper Large V3.5。

轉錄品質

使用 Word Error Rate(WER)在 Open ASR Leaderboard 的八個標準資料集(包括 AMI、GigaSpeech、LibriSpeech(Clean 與 Other)、SPGISpeech、Tedlium、VoxPopuli 與 Earnings22)上測量轉錄準確度。結果顯示,三種 Whisper 變體的 WER 表現與其 Transformers 函式庫基線相當,亦即即使速度提升,轉錄品質仍未受損。

執行效率

使用 rev16 長篇資料集(音訊段落超過 45 分鐘),Hugging Face 測量了實時因子(Real‑Time Factor,RTFx)——音訊長度與轉錄時間的比值。Whisper Large V3 的 RTFx 相較於先前實作提升近 8 倍。

部署與實作

使用者可透過 Hugging Face Endpoints 部署 ASR(自動語音辨識)推理管線,只需選擇模型並設定參數。

Python 實作範例

可使用簡單的 HTTP 請求對已部署的端點執行推理。以下為測試已部署檢查點的實作範例:

import requests

ENDPOINT_URL = "https://<your‑hf‑endpoint>.cloud/api/v1/audio/transcriptions"
HF_TOKEN     = "hf_xxxxxxxxxxxxxxxxxxxxxxxxxxxxx"
AUDIO_FILE   = "sample.wav"

headers = {"Authorization": f"Bearer {HF_TOKEN}"}

with open(AUDIO_FILE, "rb") as f:
    files = {"file": f.read()}

response = requests.post(ENDPOINT_URL, headers=headers, files=files)
response.raise_for_status()

print("Transcript:", response.json()["text"])

即時應用

這些端點的加速使得即時轉錄應用的開發成為可能。Hugging Face 透過使用 FastRTC 建置的示範,展示了即時從麥克風轉錄語音的功能。

Sources