microsoft/VibeVoice
Open-Source Frontier Voice AI
VibeVoice – 開源前沿語音AI
是什麼 – VibeVoice 是微軟維護的研究套件,提供一組先進的語音模型:
- VibeVoice‑ASR – 一種長篇自動語音辨識模型,可在單次處理中輸入最多60分鐘的音訊,並輸出結構化轉錄(含說話人分離、時間戳與內容),支援可選的熱詞自訂。
- VibeVoice‑TTS – 一種長篇多說話人語音合成模型,可生成最多90分鐘的自然語音,支援最多四種不同聲音與多種語言。
- VibeVoice‑Realtime (0.5 B) – 一種輕量級串流TTS模型,專為即時使用設計(約300 ms延遲),可連續生成數分鐘語音。
所有模型共享一項共同的架構創新:連續語音分詞器(音訊 + 語意)以極低的7.5 Hz幀率運作,搭配下一詞擴散方法,由大語言模型提供高階文字上下文,擴散頭填補細緻音訊細節。此設計在維持長序列處理的高保真度同時,也讓計算與記憶體需求保持在可管理範圍內。
主要特性
| 模型 | 大小 | 主要能力 | 長篇限制 | 多語言 | 演示 / 快速體驗 |
|---|---|---|---|---|---|
| VibeVoice‑ASR‑7B | 7 B 參數 | 帶說話人分離與時間戳的語音轉文字 | 60 分鐘(單次處理) | 50+ 語言 | Playground |
| VibeVoice‑ASR‑BitNet | 7 B(量化) | 僅CPU推理,異質量化(I8_S + I2_S) | 60 分鐘 | 50+ 語言 | VibeASR.cpp |
| VibeVoice‑TTS‑1.5B | 1.5 B | 長篇多說話人合成 | 90 分鐘 | 英語、中文等 | (目前停用) |
| VibeVoice‑Realtime‑0.5B | 0.5 B | 即時串流TTS | 約10分鐘連續 | 9種語言(EN, DE, FR, IT, JP, KR, NL, PL, PT, ES) | Colab |
- 統一分詞器以7.5 Hz運作,大幅減少序列長度,支援60分鐘ASR處理與90分鐘TTS生成。
- 下一詞擴散融合LLM級語言理解與基於擴散的音訊生成,實現高品質音訊。
- 邊緣CPU推理透過BitNet量化ASR模型(3+ CPU執行緒即時運行,無需GPU)。
- vLLM整合實現GPU上更快的ASR推理。
- 微調腳本提供ASR與TTS的微調支援,允許領域特定適配。
典型應用場景
- 一次性轉錄長會議、講座、播客,包含說話人歸屬與時間戳。
- 生成合成播客、有聲書或多人對話,無需拼接多個短片段。
- 即時語音助理或串流旁白,對低延遲有要求的場景。
- 長上下文語音處理、分詞策略或基於擴散的音訊生成等研究。
快速入門(啟動步驟)
- 選擇模型 – 決定是否需要ASR、TTS或即時串流。
- 克隆倉儲並安裝相依性(參見
requirements.txt)。 - 執行提供的Colab筆記本,實現零設定示範:
- TTS串流:
demo/vibevoice_realtime_colab.ipynb - ASR Playground:使用README中的Gradio連結。
- TTS串流:
- 透過Hugging Face載入模型(例如:
from transformers import AutoModelForSpeechSeq2Seq, AutoProcessor用於ASR,TTS使用對應載入器)。 - 可選 – 微調:若有領域特定資料,可使用
finetuning-asr/或finetuning-tts/中的腳本進行微調。 - 邊緣部署:遵循
VibeASR.cpp倉儲中的BitNet說明,在CPU上執行量化ASR模型。
風險與限制(文件說明)
- 偏見與錯誤 – 繼承自基礎Qwen2.5 1.5B模型的偏見;輸出可能不準確或反映不良刻板印象。
- 深度偽造風險 – 高品質合成語音可能被濫用於冒名或傳播虛假資訊;建議負責任揭露。
- 僅限研究用途 – 微軟建議在未經充分測試與合規檢查前,不要用於商業或生產環境部署。
- 模型大小與硬體 – 雖然0.5 B即時模型可在一般硬體上運行,但7 B ASR模型仍需GPU(或使用BitNet量化版本在CPU上運行)。
進一步了解
- 專案頁面 – https://microsoft.github.io/VibeVoice
- 技術報告 – ASR論文(arXiv 2601.18184),TTS論文(ICLR 2026口頭報告),擴散方法(arXiv 2412.08635)
- Hugging Face集合 – https://huggingface.co/collections/microsoft/vibevoice-68a2ef24a875c44be47b034f
- 示範與體驗 – ASR Playground(aka.ms/vibevoice-asr),串流TTS Colab筆記本。
社群與貢獻
倉儲包含 CONTRIBUTING.md,提供程式碼、模型與文件貢獻指南。歡迎提交問題、拉取請求與模型卡片。
相關
- Dispatch
- 專案
- Dispatch
- Dispatch
- 專案