microsoft/VibeVoice

Open-Source Frontier Voice AI

VibeVoice – 开源前沿语音AI

是什么 – VibeVoice 是微软维护的研究套件,包含一系列最先进的语音模型:

  • VibeVoice‑ASR – 一种长文本自动语音识别模型,可在单次处理中输入最多60分钟的音频,并输出结构化转录文本(包含说话人分离、时间戳和内容),支持可选的热词自定义。
  • VibeVoice‑TTS – 一种长文本多说话人文本转语音模型,可生成最多90分钟的自然语音,支持最多四个不同声音和多种语言。
  • VibeVoice‑Realtime (0.5 B) – 一种轻量级流式TTS模型,专为实时使用设计(约300 ms延迟),可连续生成数分钟语音。

所有模型共享一项共同的架构创新:连续语音分词器(声学 + 语义)以极低的7.5 Hz帧率运行,结合下一词扩散方法,由大语言模型提供高层文本上下文,扩散头填充细粒度声学细节。该设计在保持长序列处理计算和内存需求可控的同时,实现了高保真度。


主要特性

模型 大小 主要能力 长文本限制 多语言 演示 / 快速体验
VibeVoice‑ASR‑7B 7 B 参数 带说话人分离与时间戳的语音转文本 60 分钟(单次处理) 50+ 语言 Playground
VibeVoice‑ASR‑BitNet 7 B(量化) 仅CPU推理,异构量化(I8_S + I2_S) 60 分钟 50+ 语言 VibeASR.cpp
VibeVoice‑TTS‑1.5B 1.5 B 长文本多说话人合成 90 分钟 英语、中文等 (当前禁用)
VibeVoice‑Realtime‑0.5B 0.5 B 实时流式TTS 约10分钟连续 9种语言(EN, DE, FR, IT, JP, KR, NL, PL, PT, ES) Colab
  • 统一分词器以7.5 Hz运行,大幅减少序列长度,支持60分钟ASR处理和90分钟TTS生成。
  • 下一词扩散融合LLM级语言理解与基于扩散的声学生成,实现高质量音频。
  • 边缘CPU推理通过BitNet量化ASR模型(3+ CPU线程实时运行,无需GPU)。
  • vLLM集成实现GPU上更快的ASR推理。
  • 微调脚本提供ASR和TTS的微调支持,允许领域特定适配。

典型应用场景

  • 一次性转录长会议、讲座、播客,包含说话人归属和时间戳。
  • 生成合成播客、有声书或多人对话,无需拼接多个短片段。
  • 实时语音助手或流式旁白,对低延迟有要求的场景。
  • 长上下文语音处理、分词策略或基于扩散的音频生成等研究。

快速入门(启动步骤)

  1. 选择模型 – 决定是否需要ASR、TTS或实时流式。
  2. 克隆仓库并安装依赖(参见 requirements.txt)。
  3. 运行提供的Colab笔记本,实现零配置演示:
    • TTS流式:demo/vibevoice_realtime_colab.ipynb
    • ASR Playground:使用README中的Gradio链接。
  4. 通过Hugging Face加载模型(例如:from transformers import AutoModelForSpeechSeq2Seq, AutoProcessor 用于ASR,TTS使用对应加载器)。
  5. 可选 – 微调:若有领域特定数据,可使用 finetuning-asr/finetuning-tts/ 中的脚本进行微调。
  6. 边缘部署:遵循 VibeASR.cpp 仓库中的BitNet说明,在CPU上运行量化ASR模型。

风险与限制(文档说明)

  • 偏见与错误 – 继承自基础Qwen2.5 1.5B模型的偏见;输出可能不准确或反映不良刻板印象。
  • 深度伪造风险 – 高质量合成语音可能被滥用于冒名或传播虚假信息;建议负责任披露。
  • 仅限研究用途 – 微软建议在未经过充分测试和合规检查前,不要用于商业或生产环境部署。
  • 模型大小与硬件 – 虽然0.5 B实时模型可在普通硬件上运行,但7 B ASR模型仍需GPU(或使用BitNet量化版本在CPU上运行)。

进一步了解


社区与贡献

仓库包含 CONTRIBUTING.md,提供代码、模型和文档贡献指南。欢迎提交问题、拉取请求和模型卡片。

相关

  • Dispatch
  • 项目
  • Dispatch
  • Dispatch
  • 项目