PowerBeef/Vocello

Vocello: a local, private voice studio for Apple Silicon. Write a script, pick or describe a voice, and generate speech on-device, faster than realtime on an 8 GB M2 Mac mini. Native Swift + MLX, no Python. Mac app out now, iPhone beta on TestFlight. (Formerly QwenVoice.)

它解决了什么问题

Vocello 是一款专为 macOS 和 iOS 设计的本地优先、高性能的文本转语音(TTS)工作室。它通过在 Apple Silicon 硬件上直接运行生成式 AI 语音模型,彻底消除了对云端积分、账户和外部服务器的需求,确保所有脚本和录音都完全保留在用户的设备上,实现真正的隐私保护。

它如何工作

该应用使用基于 MLX(Apple 的机器学习框架)构建的原生 Swift 运行时来执行 Qwen3-TTS 模型。与许多依赖 Python 包装器的本地 TTS 工具不同,Vocello 使用专用的内部运行时(VocelloQwen3Core)来生成音频。它支持三种主要工作流程:使用内置语音、通过自然语言描述设计新语音,以及从音频参考中克隆现有语音。

适合谁使用

专为搭载 Apple Silicon 的 Mac(macOS 26+)和 iPhone 15 Pro 或更新机型(iOS 26+)的用户设计,适用于需要高质量、私密语音生成的脚本创作、长篇项目以及自定义语音角色的场景。

主要特性

  • 本地优先的隐私保护:所有生成内容、历史记录和语音参考均本地存储;数据不会离开设备。
  • 语音设计与克隆:可通过文本描述创建语音,或从音频文件/录音中克隆语音。
  • 高性能表现:针对 Apple Silicon 优化,即使在 8GB 内存设备上也能实现超实时生成速度。
  • 长文本支持:通过流式处理分段内容,可处理超过 900 个字符的脚本,保持内存占用始终处于低位。
  • 多语言支持:支持十种语言,包括英语、中文、日语、韩语、德语、法语、俄语、葡萄牙语、西班牙语和意大利语。
  • 确定性输出:支持种子固定,确保音频生成结果可复现。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目