prathoshap/vagdhenu

Vāgdhenu — metered Sanskrit/Vedic chant text-to-speech (DiT + BigVGAN). Apache-2.0.

解決する課題

Vágdhenuは、サンスクリット語の詠唱(páráyaána)に特化して設計されたプロダクショングレードのテキスト読み上げ(TTS)システムです。テキストを平坦に読み上げる一般的なTTSとは異なり、このシステムは伝統的な詠唱スタイルに忠実な、韻律を考慮した持続時間と旋律の輪郭を持つオーディオを生成します。

仕組み

このシステムは、IndicF5/F5-TTSに基づいたflow-matching Diffusion Transformer (DiT) バックボーンを使用しています。ヒンディー語のシュワ音脱落(schwa-deletion)のような問題を避けるため、サンスクリット語のテキストはKannada文字を経由して処理されます。また、長母音の安定性を確保するために、微調整されたNVIDIA BigVGAN-v2 vocoderを採用しています。

韻律(Prosody)は、リファレンスクリップ(声、swara、ペースを制御)とボイスステアリング微調整の組み合わせによって管理されます。また、visarga sandhi、homorganic anusvára、韻律/gaána検出を含む複雑なサンスクリット語の言語規則を処理する、特化したテキストフロントエンドも備えています。

対象者

研究者、開発者、および、学習、アクセシビリティ、詠唱オーディオコンテンツの制作のために、神聖なサンスクリット語の詠唱合成に関心のある実践者を対象としています。

ハイライト

  • 高忠実度: 専門のリスナーから約4.6の平均意見スコア(MOS)を獲得。
  • 言語的精度: 歯茎音の有気音を含む複雑な結合文字を正確にレンダリング。
  • 実証済みの品質: Mahábhárata Tátparya Niráya向けに17時間以上のオーディオを、ŜśƱmad Bhágavatam向けに16,000節以上の音声を生成するために使用されています。
  • 高度なフロントエンド: DevanagariからKannadaへのルーティングおよび韻律検出のためのカスタムテキスト処理パイプラインを搭載。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト