prathoshap/vagdhenu

Vāgdhenu — metered Sanskrit/Vedic chant text-to-speech (DiT + BigVGAN). Apache-2.0.

解決的問題

Vágdhenu 是一款專為梵文吟誦 (páráyaána) 設計的生產級文本轉語音 (TTS) 系統。與通常平淡朗讀文本的標準 TTS 不同,該系統生成的音訊具有符合傳統吟誦風格的韻律感知時長和旋律輪廓。

工作原理

該系統使用基於 IndicF5/F5-TTS 的 flow-matching Diffusion Transformer (DiT) 骨幹網路。為了避免類似印地語 schwa-deletion 的問題,梵文文本透過 Kannada 腳本進行路由。它採用經過微調的 NVIDIA BigVGAN-v2 聲碼器,以確保長元音的穩定性。

韻律透過參考剪輯(控制聲音、swara 和節奏)與語音引導微調結合來管理。該系統還包含一個專門的文本前端,處理複雜的梵文語言規則,包括 visarga sandhi、homorganic anusvára 以及節拍/gaána 檢測。

適用對象

專為對神聖梵文吟誦合成感興趣的研究人員、開發人員和從業者設計,用於學習、無障礙輔助以及吟誦音訊內容的製作。

亮點

  • 高保真度:從專家聽眾處獲得了約 4.6 的平均意見得分 (MOS)。
  • 語言精準度:能夠正確渲染複雜的合體字,包括複疊擦音。
  • 生產驗證:已用於為 Mahábhárata Tátparya Niráya 生成超過 17 小時的音訊,並為 ŜśƱmad Bhágavatam 生成超過 16,000 節經文。
  • 先進的前端:包含用於 Devanagari 到 Kannada 路由及節拍檢測的定制文本處理流水線。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案