microsoft/VibeVoice
Open-Source Frontier Voice AI
VibeVoice – 开源前沿语音AI
是什么 – VibeVoice 是微软维护的研究套件,包含一系列最先进的语音模型:
- VibeVoice‑ASR – 一种长文本自动语音识别模型,可在单次处理中输入最多60分钟的音频,并输出结构化转录文本(包含说话人分离、时间戳和内容),支持可选的热词自定义。
- VibeVoice‑TTS – 一种长文本多说话人文本转语音模型,可生成最多90分钟的自然语音,支持最多四个不同声音和多种语言。
- VibeVoice‑Realtime (0.5 B) – 一种轻量级流式TTS模型,专为实时使用设计(约300 ms延迟),可连续生成数分钟语音。
所有模型共享一项共同的架构创新:连续语音分词器(声学 + 语义)以极低的7.5 Hz帧率运行,结合下一词扩散方法,由大语言模型提供高层文本上下文,扩散头填充细粒度声学细节。该设计在保持长序列处理计算和内存需求可控的同时,实现了高保真度。
主要特性
| 模型 | 大小 | 主要能力 | 长文本限制 | 多语言 | 演示 / 快速体验 |
|---|---|---|---|---|---|
| VibeVoice‑ASR‑7B | 7 B 参数 | 带说话人分离与时间戳的语音转文本 | 60 分钟(单次处理) | 50+ 语言 | Playground |
| VibeVoice‑ASR‑BitNet | 7 B(量化) | 仅CPU推理,异构量化(I8_S + I2_S) | 60 分钟 | 50+ 语言 | VibeASR.cpp |
| VibeVoice‑TTS‑1.5B | 1.5 B | 长文本多说话人合成 | 90 分钟 | 英语、中文等 | (当前禁用) |
| VibeVoice‑Realtime‑0.5B | 0.5 B | 实时流式TTS | 约10分钟连续 | 9种语言(EN, DE, FR, IT, JP, KR, NL, PL, PT, ES) | Colab |
- 统一分词器以7.5 Hz运行,大幅减少序列长度,支持60分钟ASR处理和90分钟TTS生成。
- 下一词扩散融合LLM级语言理解与基于扩散的声学生成,实现高质量音频。
- 边缘CPU推理通过BitNet量化ASR模型(3+ CPU线程实时运行,无需GPU)。
- vLLM集成实现GPU上更快的ASR推理。
- 微调脚本提供ASR和TTS的微调支持,允许领域特定适配。
典型应用场景
- 一次性转录长会议、讲座、播客,包含说话人归属和时间戳。
- 生成合成播客、有声书或多人对话,无需拼接多个短片段。
- 实时语音助手或流式旁白,对低延迟有要求的场景。
- 长上下文语音处理、分词策略或基于扩散的音频生成等研究。
快速入门(启动步骤)
- 选择模型 – 决定是否需要ASR、TTS或实时流式。
- 克隆仓库并安装依赖(参见
requirements.txt)。 - 运行提供的Colab笔记本,实现零配置演示:
- TTS流式:
demo/vibevoice_realtime_colab.ipynb - ASR Playground:使用README中的Gradio链接。
- TTS流式:
- 通过Hugging Face加载模型(例如:
from transformers import AutoModelForSpeechSeq2Seq, AutoProcessor用于ASR,TTS使用对应加载器)。 - 可选 – 微调:若有领域特定数据,可使用
finetuning-asr/或finetuning-tts/中的脚本进行微调。 - 边缘部署:遵循
VibeASR.cpp仓库中的BitNet说明,在CPU上运行量化ASR模型。
风险与限制(文档说明)
- 偏见与错误 – 继承自基础Qwen2.5 1.5B模型的偏见;输出可能不准确或反映不良刻板印象。
- 深度伪造风险 – 高质量合成语音可能被滥用于冒名或传播虚假信息;建议负责任披露。
- 仅限研究用途 – 微软建议在未经过充分测试和合规检查前,不要用于商业或生产环境部署。
- 模型大小与硬件 – 虽然0.5 B实时模型可在普通硬件上运行,但7 B ASR模型仍需GPU(或使用BitNet量化版本在CPU上运行)。
进一步了解
- 项目页面 – https://microsoft.github.io/VibeVoice
- 技术报告 – ASR论文(arXiv 2601.18184),TTS论文(ICLR 2026口头报告),扩散方法(arXiv 2412.08635)
- Hugging Face集合 – https://huggingface.co/collections/microsoft/vibevoice-68a2ef24a875c44be47b034f
- 演示与体验 – ASR Playground(aka.ms/vibevoice-asr),流式TTS Colab笔记本。
社区与贡献
仓库包含 CONTRIBUTING.md,提供代码、模型和文档贡献指南。欢迎提交问题、拉取请求和模型卡片。
相关
- Dispatch
- 项目
- Dispatch
- Dispatch
- 项目