OpenAI 语音引擎:技术实现与安全框架

OpenAI 开发了语音引擎,这是一项能够创建自定义语音的合成语音技术。该技术已集成到 ChatGPT 的语音模式和文本转语音(TTS)API 中,同时其更广泛的部署通过受控的迭代框架进行,以降低合成音频相关的风险。

技术部署与产品集成

自 2023 年 9 月以来,语音引擎已在三个主要产品实现中得到使用:

  • ChatGPT 语音模式: 于 2023 年 9 月推出,此功能使用仅由真实语音创建的声音,这些真实语音通过自 2023 年 5 月起由专业配音演员、人才机构和行业顾问参与的严格筛选过程选出。
  • TTS API: 于 2023 年 11 月发布,该 API 提供六种预设语音。每种语音均使用专业配音演员的 15 秒音频样本创建。
  • 自定义语音预览: 2024 年 3 月,OpenAI 向少数可信合作伙伴预览了创建自定义语音的能力,以探索合成语音技术的风险和机遇。

安全研究与政策目标

OpenAI 使用迭代部署框架帮助政策制定者和公众了解合成语音的风险。2022 年底开发的早期内部原型——仅使用公共和私人语音样本进行内部测试——自 2023 年夏季起用于向全球政策制定者展示该技术的潜力。

通过对合作伙伴的有限自定义语音功能预览,OpenAI 旨在实现以下安全和政策目标:

  • 逐步淘汰基于语音的身份验证: 减少对语音作为访问敏感信息(如银行账户)安全措施的依赖。
  • 保护个人语音: 探索保护个人语音在 AI 中使用的政策。
  • 公众教育: 向公众普及 AI 的能力和局限性,包括潜在的欺骗性内容。
  • 内容来源追溯: 加速采用技术追踪视听内容来源,以区分 AI 生成的音频与真实人声。

内部测试与对齐

语音引擎的内部原型仅用于对齐和安全研究,以为防护措施的开发提供信息。OpenAI 指出,这些早期内部测试的输出仅用于内部测试,未用于训练驱动其面向公众产品的模型。

Sources