QwenAudio/SenseVoice
Open-source SenseVoiceSmall model for Mandarin, Cantonese, English, Japanese, and Korean ASR, language ID, emotion recognition, and audio event detection.
解決的問題
SenseVoice 是一個設計用於同時處理多種音訊理解任務的語音基礎模型。它解決了多語言環境下高精度、低延遲語音辨識的需求,同時捕捉標準 ASR 系統中常被忽略的非語言線索(如情緒和環境聲音)。
工作原理
SenseVoice 採用非自回歸端對端框架,實現極低延遲的推論。發布的 SenseVoiceSmall 檢查點支援自動語音辨識(ASR)、說話語言識別(LID)、語音情感辨識(SER)和音訊事件檢測(AED)。它可以作為基於 FastAPI 的 Python 服務部署,導出為 ONNX 或 Libtorch 以獲得優化性能,或使用 llama.cpp/GGUF 在 CPU/邊緣設備上以獨立二進位檔形式運行。
適用對象
需要多語言支援(特別是普通話、粵語、英語、日語和韓語)並能即時檢測情緒狀態或特定音訊事件(如笑聲或咳嗽)的語音應用開發者與研究人員。
主要亮點
- 多任務能力:一個模型即可完成 ASR、語言識別、情感識別和音訊事件檢測。
- 高效率:非自回歸架構使其運行速度顯著快於 Whisper-Small 和 Whisper-Large。
- 豐富轉錄:可檢測常見的「人機互動事件」(如鼓掌、哭泣、打噴嚏)和情感語調。
- 靈活部署:支援 GPU、CPU 和邊緣設備部署,透過 GGUF 實現,二進位版本無需 Python 執行時。
- 支援微調:提供腳本與策略,可將模型適配至特定業務場景或長尾樣本。
相關
- 專案
- 專案
- 專案
- 專案
- 專案