OpenAI Voice Engine:合成语音能力与安全框架
OpenAI 已推出 Voice Engine,这是一种文本转语音模型,只需 15 秒的音频样本即可生成自然逼真的语音,且可模仿特定说话人。虽然该技术在提升可及性和全球沟通方面展现出巨大潜力,OpenAI 仍将其发布范围限制在少数可信合作伙伴,以应对合成语音被滥用的风险。
Voice Engine 技术能力
Voice Engine 能够在极少的数据下创建富有情感且逼真的合成语音。模型仅需一段 15 秒的音频样本和文本输入,即可生成与原说话人高度相似的语音。
该技术于 2022 年底研发,已为 OpenAI 的文本转语音 API 中的预设语音提供动力,并用于 ChatGPT 中的 Voice 与 Read Aloud 功能。模型的关键技术特性之一是能够在翻译过程中保留原说话人的本土口音;例如,使用法语说话人的音频样本生成英文语音时,英文会带有法语口音。
早期应用与使用场景
OpenAI 正在与少数合作伙伴共同测试 Voice Engine,以探索在各行业的高影响力应用:
教育与可及性
- 阅读辅助: Age of Learning 使用该模型生成预编写的配音内容以及面向学生的实时个性化回应,提供比标准预设选项更丰富的情感化语音。
- 非语言交流: Livox 将 Voice Engine 集成到增强与替代交流(AAC)设备中,使非语言者能够使用独特、非机器人化的语音,并在多语言之间保持一致性。
全球覆盖与翻译
- 内容翻译: HeyGen 利用该模型进行视频翻译,使创作者能够将自己的声音翻译成多种语言,同时保持原有的声线特征。
- 关键服务交付: Dimagi 将 Voice Engine 与 GPT-4 结合,为社区卫生工作者提供使用当地语言(包括斯瓦希里语和肯尼亚的代码混合语言 Sheng)的交互式反馈。
医疗康复
- 语音恢复: Lifespan 的 Norman Prince Neurosciences Institute 正在试点该技术,以帮助语言障碍患者。一次案例中,医生使用患者之前学校项目中的 15 秒片段,为因血管性脑肿瘤失去流利语言的患者恢复了声音。
安全框架与部署防护措施
鉴于可能被用于冒充和欺骗,OpenAI 为当前预览版实施了严格的安全框架:
- 同意与政策: 合作伙伴必须遵守使用政策,禁止在未获同意的情况下冒充个人或组织。必须取得原说话人的明确知情同意。
- 开发者限制: 禁止开发者构建允许个人用户自行创建语音的工具。
- 透明度: 所有 AI 生成的语音必须向受众明确披露。
- 技术防护措施: OpenAI 实施了水印技术以追溯生成音频的来源,并对使用情况进行主动监控。
OpenAI 建议,未来的大规模部署应加入语音身份验证以核实原说话人,并设立“禁用语音名单”,防止复制知名人物的声音。
社会影响与建议
OpenAI 目前并未大规模发布 Voice Engine,理由是需要加强社会对高度可信生成模型的韧性。实验室提出以下系统性改进建议:
- 安全更新: 逐步淘汰基于语音的银行账户及其他敏感数据的身份验证方式。
- 政策制定: 制定政策以保护个人声音在 AI 中的合法使用。
- 公众教育: 提升公众对 AI 能力与局限的认知,特别是对欺骗性内容的风险。
- 来源追踪: 加速采用技术手段追踪视听内容的来源,以区分真实人声与 AI 合成声。