microsoft/VibeVoice
Open-Source Frontier Voice AI
VibeVoice – 오픈소스 최전방 음성 AI
무엇인가요 – VibeVoice는 마이크로소프트가 유지 관리하는 연구용 툴킷으로, 최첨단 음성 모델 패밀리를 제공합니다:
- VibeVoice‑ASR – 최대 60분의 음성을 단일 패스로 입력하고, 화자 분리, 타임스탬프, 콘텐츠를 포함한 구조화된 자막을 출력할 수 있는 장문 자동 음성 인식 모델입니다. 선택적 핫워드 사용자 정의도 가능합니다.
- VibeVoice‑TTS – 최대 90분의 자연스러운 음성을 생성할 수 있는 장문 다중 화자 음성 합성 모델로, 최대 4개의 별도 목소리와 여러 언어를 지원합니다.
- VibeVoice‑Realtime (0.5 B) – 실시간 사용을 위한 가벼운 스트리밍 TTS 모델로, 약 300ms의 지연 시간을 가지며 수분 간 지속 생성이 가능합니다.
모든 모델은 공통된 아키텍처 혁신을 공유합니다: 매우 낮은 7.5 Hz 프레임 레이트로 작동하는 연속 음성 토크나이저(음향 + 의미)와, LLM이 고수준 텍스트 컨텍스트를 제공하고 확산 헤드가 세부 음향 정보를 채우는 다음 토큰 확산(next-token diffusion) 방식입니다. 이 설계는 긴 시퀀스에서도 높은 품질을 유지하면서도 계산 및 메모리 요구량을 관리 가능한 수준으로 유지합니다.
주요 기능
| 모델 | 크기 | 주요 기능 | 장문 제한 | 다국어 | 데모 / 즉시 시도 |
|---|---|---|---|---|---|
| VibeVoice‑ASR‑7B | 7 B 파라미터 | 화자 분리 및 타임스탬프 포함 음성-텍스트 변환 | 60분 (단일 패스) | 50개 이상 언어 | Playground |
| VibeVoice‑ASR‑BitNet | 7 B (양자화됨) | CPU 전용 추론, 이종 양자화 (I8_S + I2_S) | 60분 | 50개 이상 언어 | VibeASR.cpp |
| VibeVoice‑TTS‑1.5B | 1.5 B | 장문 다중 화자 합성 | 90분 | 영어, 중국어 등 | (현재 비활성화됨) |
| VibeVoice‑Realtime‑0.5B | 0.5 B | 실시간 스트리밍 TTS | 약 10분 지속 | 9개 언어 (EN, DE, FR, IT, JP, KR, NL, PL, PT, ES) | Colab |
- 7.5 Hz의 통합 토크나이저는 시퀀스 길이를 극적으로 단축하여 60분 ASR 처리와 90분 TTS 생성을 가능하게 합니다.
- 다음 토큰 확산은 LLM 수준의 언어 이해와 확산 기반 음향 생성을 통합하여 고품질 오디오를 생성합니다.
- BitNet 양자화된 ASR 모델을 통한 엣지 CPU 추론 (3개 이상 CPU 스레드에서 실시간, GPU 필요 없음).
- vLLM 통합을 통한 GPU에서의 더 빠른 ASR 추론.
- ASR 및 TTS에 대한 미세 조정 스크립트 제공으로 도메인 특화 적응이 가능합니다.
일반적인 사용 사례
- 회의, 강의, 팟캐스트 등의 장문 음성 자료를 한 번의 실행으로 화자 분리 및 타임스탬프 포함 자막으로 변환.
- 여러 짧은 클립을 연결하지 않고도 합성 팟캐스트, 오디오북, 다중 화자 대화 생성.
- 낮은 지연 시간이 필요한 실시간 음성 어시스턴트 또는 스트리밍 내레이션.
- 장문 컨텍스트 음성 처리, 토크나이저 전략, 확산 기반 오디오 생성에 대한 연구.
시작하기 (빠른 시작 단계)
- 모델 선택 – ASR, TTS, 또는 실시간 스트리밍이 필요한지 결정.
- 리포지토리 복제하고 종속성 설치 (see
requirements.txt). - 제공된 Colab 노트북 실행으로 세팅 없이 데모 체험:
- TTS 스트리밍:
demo/vibevoice_realtime_colab.ipynb - ASR 플레이그라운드: README에 있는 Gradio 링크 사용.
- TTS 스트리밍:
- Hugging Face를 통해 모델 로드 (예:
from transformers import AutoModelForSpeechSeq2Seq, AutoProcessor로 ASR, TTS용 로더도 동일). - 옵션 – 미세 조정 – 도메인 특화 데이터가 있다면
finetuning-asr/또는finetuning-tts/스크립트 사용. - 엣지 배포를 위한 –
VibeASR.cpp리포지토리의 BitNet 지침을 따라 양자화된 ASR 모델을 CPU에서 실행.
위험 및 제한 사항 (문서화됨)
- 편향 및 오류 – 기반 모델인 Qwen2.5 1.5B의 편향을 상속받을 수 있으며, 출력이 정확하지 않거나 원치 않는 스테레오타입을 반영할 수 있음.
- 딥페이크 가능성 – 고품질 합성 음성은 위조 또는 오보에 악용될 수 있음. 책임 있는 공개를 권장.
- 연구용 라이선스 – 마이크로소프트는 충분한 테스트와 준수 점검 없이 상용 또는 생산 환경 배포를 권장하지 않음.
- 모델 크기 및 하드웨어 – 0.5 B 실시간 모델은 보통 하드웨어에서 작동 가능하지만, 7 B ASR 모델은 GPU가 필요 (또는 BitNet 양자화 버전으로 CPU에서 가능).
더 알아보기
- 프로젝트 페이지 – https://microsoft.github.io/VibeVoice
- 기술 보고서 – ASR 논문 (arXiv 2601.18184), TTS 논문 (ICLR 2026 오랄), 확산 방법 (arXiv 2412.08635)
- Hugging Face 컬렉션 – https://huggingface.co/collections/microsoft/vibevoice-68a2ef24a875c44be47b034f
- 플레이그라운드 및 데모 – ASR 플레이그라운드 (aka.ms/vibevoice-asr), 스트리밍 TTS Colab 노트북.
커뮤니티 및 기여
리포지토리에는 코드, 모델, 문서 기여를 위한 지침이 포함된 CONTRIBUTING.md가 있습니다. 이슈, 풀 리퀘스트, 모델 카드를 환영합니다.
관련
- Dispatch
- 프로젝트
- Dispatch
- Dispatch
- 프로젝트