supertone-inc/supertonic
Lightning-Fast, On-Device, Multilingual TTS — running natively via ONNX.
解决的问题
Supertonic 是一个高性能的设备端文本转语音 (TTS) 系统,它消除了对云端 API 的需求,降低了延迟并提高了隐私性。它为庞大的 TTS 模型提供了一种轻量级的替代方案,允许在移动设备、浏览器和 Raspberry Pi 等资源受限的硬件上本地运行录音室级的音频合成。
工作原理
Supertonic 由 ONNX Runtime 提供支持,使用紧凑的 99M 参数开源权重模型在设备上完全执行推理。它支持 31 种语言,并在输入语言未知时可以以语言无关模式 (lang="na") 运行。该系统输出 44.1kHz 16-bit WAV 音频,并包含一组表情标签(例如 <laugh>, <breath>),无需复杂的提示工程即可为语音添加类人细微差别。
适用对象
构建“本地优先”应用程序的开发者,例如浏览器扩展、电子书阅读器和边缘设备软件,这些应用需要快速、私密且高质量的语音合成,而无需依赖 GPU 或网络连接。
亮点
- 边缘端就绪:可在桌面、移动端、浏览器(通过 WebGPU/WASM)和 Raspberry Pi 上本地运行。
- 多语言支持:支持 31 种语言,并具有可选的语言无关处理模式。
- 紧凑型模型:99M 参数占用空间显著小于典型的 0.7B-2B 级 TTS 系统。
- 广泛的 SDK 支持:为 Python, Node.js, Java, C++, C#, Go, Swift, iOS, Rust 和 Flutter 提供即插即用的示例。
- 自然的文本处理:专门用于准确读取金融术语、电话号码和技术单位。
- 表情标签:内置用于叹气和笑声等非语言声音的标签,以增强真实感。
相关
- 项目
- 项目
- 项目
- 项目
- 项目