Ampixa/sanoTTS
sanoTTS (सानो = 'small' in Nepali): a ~1.4M-param neural TTS that runs on a $3 chip or in the browser. Leads SCOREQ/UTMOS in the sub-15M class.
解决的问题
sanoTTS 提供了一组极小的神经文本转语音(TTS)语音,可在无需云连接、专用神经处理单元(NPU)或服务器的情况下,在低功耗硬件上本地运行。它使 $3 的 ESP32-S3 微控制器或通过 WebAssembly(WASM)在浏览器中直接实现实时语音合成成为可能。
工作原理
该系统采用多阶段流水线:espeak-ng 语音化器将文本转换为音素 ID,持续时间模型预测时间,声学模型预测生成器潜在变量,解码器生成最终音频。根据目标平台,使用不同的解码器:浏览器使用紧凑的时间域解码器(fp32 WASM),微控制器使用量化后的 int8 iSTFT 解码器,以确保实时性能。
适用人群
- 嵌入式开发者:希望在廉价微控制器上构建语音设备的开发者。
- Web 开发者:希望为其网站添加客户端、无服务器 TTS 的开发者。
- Python 开发者:寻找轻量级、无依赖 TTS 库的开发者。
特点
- 超小体积:模型参数范围从 294k 到 2.3M,最小模型(heart-nano)仅占 337 KB。
- 广泛的语言支持:涵盖 16 种语言的 30 个语音,包括英语、西班牙语、法语、阿拉伯语和尼泊尔语。
- 高效率:在 ESP32-S3 上实现 0.383 的实时因子(RTF),意味着语音合成速度比实时快 2.6 倍。
- 零依赖:Python 包使用纯 numpy 进行推理,浏览器版本完全在客户端运行。
- 可定制:提供完整的训练流程,用户可创建并蒸馏自己的语音。
相关
- 项目
- 项目
- 项目
- 项目