microsoft/VibeVoice

Open-Source Frontier Voice AI

VibeVoice – 開発者向け先進音声AIのオープンソース実装

何がここにあるか – VibeVoiceはマイクロソフトが維持する研究用ツールキットで、最先端の音声モデルのファミリーを提供しています:

  • VibeVoice‑ASR – 1回の処理で最大60分の音声を入力し、話者分離・タイムスタンプ・コンテンツを含む構造化された字幕を出力できる長文自動音声認識モデル。ホットワードカスタマイズもオプションで可能。
  • VibeVoice‑TTS – 最大90分の自然な音声を生成できる長文マルチスピーク音声合成モデル。最大4つの異なる声と複数の言語をサポート。
  • VibeVoice‑Realtime (0.5 B) – 軽量でストリーミング用に設計されたTTSモデル。リアルタイム処理(約300msの遅延)が可能で、数分間の継続生成も可能。

すべてのモデルは共通のアーキテクチャ的革新を共有しています:連続音声トークナイザー(音響+意味)は非常に低い7.5 Hzのフレームレートで動作し、次のトークン拡散アプローチではLLMが高レベルのテキストコンテキストを提供し、拡散ヘッドが細かい音響詳細を埋め込みます。この設計により、長文シーケンスでも高忠実度を維持しつつ、計算量とメモリ使用量を制御可能です。


主な特徴

モデル サイズ 主な機能 長文制限 多言語対応 デモ/即時試用
VibeVoice‑ASR‑7B 7 Bパラメータ 話者分離・タイムスタンプ付き音声認識 60分(1回処理) 50言語以上 Playground
VibeVoice‑ASR‑BitNet 7 B(量子化済み) CPU専用推論、異種量子化(I8_S + I2_S) 60分 50言語以上 VibeASR.cpp
VibeVoice‑TTS‑1.5B 1.5 B 長文マルチスピーク合成 90分 英語、中国語など (現時点では無効化)
VibeVoice‑Realtime‑0.5B 0.5 B リアルタイムストリーミングTTS 約10分継続 9言語(EN, DE, FR, IT, JP, KR, NL, PL, PT, ES) Colab
  • 7.5 Hzの統一トークナイザーにより、シーケンス長が大幅に短縮され、60分のASR処理と90分のTTS生成が可能に。
  • 次のトークン拡散により、LLMレベルの言語理解と拡散ベースの音響生成を統合し、高品質な音声を実現。
  • BitNet量子化されたASRモデルによるエッジCPU推論(3+CPUスレッドでリアルタイム、GPU不要)。
  • vLLM統合によりGPU上でASR推論を高速化。
  • ASRおよびTTSの微調整スクリプトが提供され、ドメイン特化のカスタマイズが可能。

一般的な利用シーン

  • 会議、講義、ポッドキャストなどの長文音声を、話者分離とタイムスタンプ付きで1回の処理で字幕化。
  • 複数の短いクリップをつなぎ合わせる必要なく、合成ポッドキャスト、オーディオブック、マルチスピーク会話の生成。
  • 低遅延が求められるリアルタイム音声アシスタントやストリーミングナレーション。
  • 長文コンテキスト音声処理、トークナイゼーション戦略、拡散ベース音声生成に関する研究。

すぐに始める(クイックスタート手順)

  1. モデルを選択 – ASR、TTS、またはリアルタイムストリーミングが必要かを判断。
  2. リポジトリをクローンし、依存関係をインストール(requirements.txtを参照)。
  3. 提供されたColabノートブックを実行して、セットアップ不要のデモを体験:
    • TTSストリーミング:demo/vibevoice_realtime_colab.ipynb
    • ASRプレイグラウンド:README内のGradioリンクを使用。
  4. Hugging Face経由でモデルをロード(例:from transformers import AutoModelForSpeechSeq2Seq, AutoProcessor でASR、TTS用ローダーも同様)。
  5. オプションfinetuning-asr/ または finetuning-tts/ のスクリプトを使って、ドメイン特化データがある場合に微調整可能。
  6. エッジデプロイの場合は、VibeASR.cppリポジトリのBitNet手順に従い、量子化されたASRモデルをCPU上で実行。

リスクと制限(ドキュメント記載)

  • バイアスと誤り – 基盤となるQwen2.5 1.5Bモデルのバイアスを引き継ぐ可能性あり。出力が不正確または望ましくないステレオタイプを反映する可能性。
  • ディープフェイクのリスク – 高品質な合成音声は、偽の人物や誤情報の作成に悪用される可能性あり。責任ある報告を推奨。
  • 研究用ライセンス – マイクロソフトは、十分なテストとコンプライアンス確認を行わずに商用・本番環境への導入を推奨しない。
  • モデルサイズとハードウェア – 0.5 Bリアルタイムモデルは低スペックハードウェアでも動作可能だが、7 B ASRモデルはGPUが必要(またはBitNet量子化版でCPU推論可能)。

詳細情報の入手先


コミュニティと貢献

リポジトリにはCONTRIBUTING.mdがあり、コード、モデル、ドキュメントの貢献ガイドラインが記載されています。Issue、Pull Request、モデルカードの提出を歓迎します。

関連

  • Dispatch
  • プロジェクト
  • Dispatch
  • Dispatch
  • プロジェクト