PowerBeef/Vocello
Vocello: a local, private voice studio for Apple Silicon. Write a script, pick or describe a voice, and generate speech on-device, faster than realtime on an 8 GB M2 Mac mini. Native Swift + MLX, no Python. Mac app out now, iPhone beta on TestFlight. (Formerly QwenVoice.)
它解決的問題
Vocello 是一款針對 macOS 和 iOS 的本地優先、高性能語音合成(TTS)工作室。它透過在 Apple Silicon 硬體上直接執行生成式 AI 語音模型,消除了對雲端憑證、帳戶和外部伺服器的需求,確保所有腳本和錄音都保留在使用者的裝置上,完全私密。
如何運作
該應用程式使用基於 MLX(Apple 的機器學習框架)的原生 Swift 執行環境,來執行 Qwen3-TTS 模型。與許多依賴 Python 包裝器的本地 TTS 工具不同,Vocello 使用專用的第一方執行環境(VocelloQwen3Core)來生成音訊。它支援三種主要工作流程:使用內建語音、透過自然語言描述設計新語音,以及從音訊參考中克隆現有語音。
適用對象
適用於使用 Apple Silicon Mac(macOS 26+)或 iPhone 15 Pro 及更新型號(iOS 26+)的使用者,他們需要為腳本、長篇專案和自訂語音角色生成高品質且私密的語音。
主要特色
- 本地優先的隱私保護:所有生成內容、歷史記錄和語音參考均儲存在本地;無資料離開裝置。
- 語音設計與克隆:可根據文字描述建立語音,或從音訊檔案/錄音中克隆語音。
- 高效率性能:針對 Apple Silicon 優化,即使在 8GB RAM 裝置上也能實現快於即時的生成速度。
- 支援長篇內容:透過串流處理片段,可處理超過 900 字元的腳本,維持平坦的記憶體使用量。
- 多語言支援:支援十種語言,包括英文、中文、日文、韓文、德文、法文、俄文、葡萄牙文、西班牙文和義大利文。
- 可重現輸出:支援種子鎖定,確保音訊輸出可重複產生。
相關
- 專案
- 專案
- 專案
- 專案
- 專案