prathoshap/vagdhenu
Vāgdhenu — metered Sanskrit/Vedic chant text-to-speech (DiT + BigVGAN). Apache-2.0.
解决的问题
Vágdhenu 是一款专为梵文吟诵 (páráyaána) 设计的生产级文本转语音 (TTS) 系统。与通常平淡朗读文本的标准 TTS 不同,该系统生成的音频具有符合传统吟诵风格的韵律感知时长和旋律轮廓。
工作原理
该系统使用基于 IndicF5/F5-TTS 的 flow-matching Diffusion Transformer (DiT) 骨干网络。为了避免类似印地语 schwa-deletion 的问题,梵文文本通过 Kannada 脚本进行路由。它采用经过微调的 NVIDIA BigVGAN-v2 声码器,以确保长元音的稳定性。
韵律通过参考剪辑(控制声音、swara 和节奏)和语音引导微调相结合来管理。该系统还包含一个专门的文本前端,处理复杂的梵文语言规则,包括 visarga sandhi、homorganic anusvára 以及节拍/gaána 检测。
适用对象
专为对神圣梵文吟诵合成感兴趣的研究人员、开发人员和从业者设计,用于学习、无障碍辅助以及吟诵音频内容的制作。
亮点
- 高保真度:从专家听众处获得了约 4.6 的平均意见得分 (MOS)。
- 语言精准度:能够正确渲染复杂的合体字,包括复叠擦音。
- 生产验证:已用于为 Mahábhárata Tátparya Niráya 生成超过 17 小时的音频,并为 ŜśƱmad Bhágavatam 生成超过 16,000 节经文。
- 先进的前端:包含用于 Devanagari 到 Kannada 路由及节拍检测的定制文本处理流水线。
相关
- 项目
- 项目
- 项目
- 项目
- 项目