Aivis-Project/AivisSpeech

AivisSpeech: AI Voice Imitation System - Text to Speech Software

What it solves

AivisSpeech は、感情豊かな音声を生成するために設計された日本語テキスト読み上げ (TTS) ソフトウェアです。VOICEVOX をベースにしたユーザーフレンドリーなエディタ UI を提供し、ユーザーがテキストから簡単に合成音声を生成できるようにします。

How it works

このソフトウェアは、AIVMX (Aivis Voice Model for ONNX) オープンファイル形式を利用する AivisSpeech Engine を統合しています。この形式は、学習済みモデル、ハイパーパラメータ、スタイルベクトル、および話者メタデータ (metadata) を単一のファイルにまとめます。ONNX Runtime を使用することで、このシステムは高速な CPU 推論 (inference) を実現し、PyTorch への依存関係を排除することで、インストールサイズを削減します。

Who it’s for

主に、高品質な日本語合成音声が必要なコンテンツクリエイターや開発者向けです。Windows と macOS (特に Apple Silicon) のユーザーをサポートしています。

Highlights

  • ONNX-based Inference: AIVMX ファイルを使用して、高速な CPU パフォーマンスと、より小さなフットプリントを実現します。
  • VOICEVOX-based UI: お馴染みのエディタインターフェースを活用して、直感的な音声合成を行います。
  • AIVM Specification: メタデータや話者情報を含む、音声モデルの標準化されたオープンファイル形式をサポートしています。
  • Architecture Support: Style-Bert-VITS2 および Style-Bert-VITS2 (JP-Extra) モデルアーキテクチャに対応しています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト