xAI Custom Voices 发布
xAI 推出了 Custom Voices,这项功能允许用户通过几秒钟的音频克隆自己的声音,并立即集成到 Grok Text to Speech (TTS) 和 Voice Agent APIs 中。这使得开发者和创作者能够将通用的预设替换为个性化、品牌一致或保留身份特征的语音模型。
快速语音克隆与集成
用户只需在 xAI 控制台中录制大约一分钟的自然语音,即可在不到两分钟内创建生产级的语音模型。一旦创建,这些自定义语音将与现有的 Grok 音频功能完全兼容,包括:
- Speech Tags: 支持对表达方式进行细微控制。
- Multilingual Output: 支持生成多种语言的语音。
- Streaming: 支持 REST 和 WebSocket 流式传输。
要实现自定义语音,开发者只需将特定的 voice_id 传递给任何 TTS 端点或用于实时对话代理的 Voice Agent API。xAI 表示,使用这些 API 调用自定义语音不会产生额外费用。
关键用例
Custom Voices 旨在支持不同行业中的广泛应用:
- Brand Identity: 公司可以部署具有一致且可识别的声音的客户支持代理,使其与品牌身份保持一致。
- Content Creation: 创作者可以大规模地为视频、播客和社交媒体帖子进行旁白,而无需重复进行手动录音。
- Accessibility: 该技术可用于保留失去说话能力的人士的语音身份。
- Multilingual Communication: 组织机构可以在保持原讲者声音的同时,以多种主要语言(包括 English, Spanish, French, German, Chinese, 和 Japanese)发布主题演讲或信息。
- Entertainment: 游戏开发者和作者可以为对话和有声书旁白创建独特的角色声音,而无需占用大量的录音室时间。
语音安全与验证
为了防止未经授权的克隆以及使用预先存在的录音,xAI 采用了两阶段验证过程:
- Passphrase Check: 说话者必须大声朗读特定的验证短语。STT (Speech-to-Text) 引擎会实时转录并匹配该短语,以确认用户的同意和在场。
- Speaker Similarity: 系统会从验证片段和完整的录音中计算说话者嵌入(speaker embeddings),并进行比较以确保两个音频样本属于同一个人。
根据 xAI 的说法,这些保障措施确保了用户无法从预先存在的录音中克隆声音,也无法克隆他人的声音。
Sources
- OriginalCustom Voices
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch