QwenAudio/SenseVoice

Open-source SenseVoiceSmall model for Mandarin, Cantonese, English, Japanese, and Korean ASR, language ID, emotion recognition, and audio event detection.

解決的問題

SenseVoice 是一個設計用於同時處理多種音訊理解任務的語音基礎模型。它解決了多語言環境下高精度、低延遲語音辨識的需求,同時捕捉標準 ASR 系統中常被忽略的非語言線索(如情緒和環境聲音)。

工作原理

SenseVoice 採用非自回歸端對端框架,實現極低延遲的推論。發布的 SenseVoiceSmall 檢查點支援自動語音辨識(ASR)、說話語言識別(LID)、語音情感辨識(SER)和音訊事件檢測(AED)。它可以作為基於 FastAPI 的 Python 服務部署,導出為 ONNX 或 Libtorch 以獲得優化性能,或使用 llama.cpp/GGUF 在 CPU/邊緣設備上以獨立二進位檔形式運行。

適用對象

需要多語言支援(特別是普通話、粵語、英語、日語和韓語)並能即時檢測情緒狀態或特定音訊事件(如笑聲或咳嗽)的語音應用開發者與研究人員。

主要亮點

  • 多任務能力:一個模型即可完成 ASR、語言識別、情感識別和音訊事件檢測。
  • 高效率:非自回歸架構使其運行速度顯著快於 Whisper-Small 和 Whisper-Large。
  • 豐富轉錄:可檢測常見的「人機互動事件」(如鼓掌、哭泣、打噴嚏)和情感語調。
  • 靈活部署:支援 GPU、CPU 和邊緣設備部署,透過 GGUF 實現,二進位版本無需 Python 執行時。
  • 支援微調:提供腳本與策略,可將模型適配至特定業務場景或長尾樣本。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案