microsoft/VibeVoice

Open-Source Frontier Voice AI

VibeVoice – 開源前沿語音AI

是什麼 – VibeVoice 是微軟維護的研究套件,提供一組先進的語音模型:

  • VibeVoice‑ASR – 一種長篇自動語音辨識模型,可在單次處理中輸入最多60分鐘的音訊,並輸出結構化轉錄(含說話人分離、時間戳與內容),支援可選的熱詞自訂。
  • VibeVoice‑TTS – 一種長篇多說話人語音合成模型,可生成最多90分鐘的自然語音,支援最多四種不同聲音與多種語言。
  • VibeVoice‑Realtime (0.5 B) – 一種輕量級串流TTS模型,專為即時使用設計(約300 ms延遲),可連續生成數分鐘語音。

所有模型共享一項共同的架構創新:連續語音分詞器(音訊 + 語意)以極低的7.5 Hz幀率運作,搭配下一詞擴散方法,由大語言模型提供高階文字上下文,擴散頭填補細緻音訊細節。此設計在維持長序列處理的高保真度同時,也讓計算與記憶體需求保持在可管理範圍內。


主要特性

模型 大小 主要能力 長篇限制 多語言 演示 / 快速體驗
VibeVoice‑ASR‑7B 7 B 參數 帶說話人分離與時間戳的語音轉文字 60 分鐘(單次處理) 50+ 語言 Playground
VibeVoice‑ASR‑BitNet 7 B(量化) 僅CPU推理,異質量化(I8_S + I2_S) 60 分鐘 50+ 語言 VibeASR.cpp
VibeVoice‑TTS‑1.5B 1.5 B 長篇多說話人合成 90 分鐘 英語、中文等 (目前停用)
VibeVoice‑Realtime‑0.5B 0.5 B 即時串流TTS 約10分鐘連續 9種語言(EN, DE, FR, IT, JP, KR, NL, PL, PT, ES) Colab
  • 統一分詞器以7.5 Hz運作,大幅減少序列長度,支援60分鐘ASR處理與90分鐘TTS生成。
  • 下一詞擴散融合LLM級語言理解與基於擴散的音訊生成,實現高品質音訊。
  • 邊緣CPU推理透過BitNet量化ASR模型(3+ CPU執行緒即時運行,無需GPU)。
  • vLLM整合實現GPU上更快的ASR推理。
  • 微調腳本提供ASR與TTS的微調支援,允許領域特定適配。

典型應用場景

  • 一次性轉錄長會議、講座、播客,包含說話人歸屬與時間戳。
  • 生成合成播客、有聲書或多人對話,無需拼接多個短片段。
  • 即時語音助理或串流旁白,對低延遲有要求的場景。
  • 長上下文語音處理、分詞策略或基於擴散的音訊生成等研究。

快速入門(啟動步驟)

  1. 選擇模型 – 決定是否需要ASR、TTS或即時串流。
  2. 克隆倉儲並安裝相依性(參見 requirements.txt)。
  3. 執行提供的Colab筆記本,實現零設定示範:
    • TTS串流:demo/vibevoice_realtime_colab.ipynb
    • ASR Playground:使用README中的Gradio連結。
  4. 透過Hugging Face載入模型(例如:from transformers import AutoModelForSpeechSeq2Seq, AutoProcessor 用於ASR,TTS使用對應載入器)。
  5. 可選 – 微調:若有領域特定資料,可使用 finetuning-asr/finetuning-tts/ 中的腳本進行微調。
  6. 邊緣部署:遵循 VibeASR.cpp 倉儲中的BitNet說明,在CPU上執行量化ASR模型。

風險與限制(文件說明)

  • 偏見與錯誤 – 繼承自基礎Qwen2.5 1.5B模型的偏見;輸出可能不準確或反映不良刻板印象。
  • 深度偽造風險 – 高品質合成語音可能被濫用於冒名或傳播虛假資訊;建議負責任揭露。
  • 僅限研究用途 – 微軟建議在未經充分測試與合規檢查前,不要用於商業或生產環境部署。
  • 模型大小與硬體 – 雖然0.5 B即時模型可在一般硬體上運行,但7 B ASR模型仍需GPU(或使用BitNet量化版本在CPU上運行)。

進一步了解


社群與貢獻

倉儲包含 CONTRIBUTING.md,提供程式碼、模型與文件貢獻指南。歡迎提交問題、拉取請求與模型卡片。

相關

  • Dispatch
  • 專案
  • Dispatch
  • Dispatch
  • 專案