Hugging Face Voice Cloning with Consent

Hugging Face 推出了“语音同意门控”,这是一个技术框架,旨在确保语音克隆仅在说话者提供明确的录制同意后才发生。此方法将同意这一抽象伦理原则转化为系统功能的前置条件,防止模型在未获得用户主动许可的情况下生成用户声音的合成语音。

同意即系统基础设施

语音同意门控通过将模型的激活依赖于特定同意短语的识别,将伦理原则直接嵌入到 AI 工作流中。这创造了一个可追溯且可审计的交互,其中明确的同意行为是系统运行的强制条件。通过默认设计系统以尊重自主权,透明度和同意成为功能需求,而不仅仅是声明性陈述。

语音同意门控的技术实现

一个带有同意门控的基本语音克隆系统需要三个主要组件:

  1. 同意句子生成:一种方法,为说话者创建新颖的句子供其朗读,这些句子唯一地引用当前的同意上下文。
  2. 自动语音识别 (ASR):一个系统,用于识别说话者的句子以验证同意。
  3. 语音克隆文本转语音 (TTS):一个系统,使用说话者的语音片段生成新的音频。

同意与克隆过程

Hugging Face 观察到,现代语音克隆系统可以仅使用单个句子生成语音,因此用于验证同意的句子同时也可以作为克隆过程的技术输入。

同意机制 为了确保同意是知情且特定于上下文的,系统会生成一个简短的英文话语(大约 20 词),其中包含特定的同意短语以及正在使用的模型名称(例如:“我同意使用 < MODEL > 语音克隆模型并使用我的声音”)。为了最小化使用被操纵或预先存在的录音的风险,系统建议:

  • 使用直接麦克风输入而不是文件上传。
  • 生成新颖且之前未说过的句子以索引当前会话。

确保技术质量 为了获得高质量的合成,输入音频必须具备语音多样性、中性或礼貌的语调,以及清晰的开始和结束。为此,语言模型为每个用户生成句子对:

  • 一句表达明确同意的句子。
  • 一句关于随机日常话题(例如天气、食物或音乐)的中性句子,以提供有效克隆所需的多样元音和辅音。

示例生成的短语包括:“我同意今天使用我的声音通过 Chatterbox 模型生成合成音频。我的日常通勤大多数日子都是步行穿越拥挤的街道。”

解锁语音克隆系统

一旦 ASR 系统验证说话者的输入与生成的文本匹配,语音克隆系统将被解锁。Hugging Face 为此工作流程提供了几种实现选项:

  • 直接激活:同意音频直接用作语音克隆模型的种子,以生成任意文本。
  • 外部文件同意:可以修改系统,以允许说话者同意使用各种其他上传的语音文件(例如在线录音)。
  • 持久同意:同意音频可以通过 huggingface_hub 上传功能保存,以便在系统中未来使用,前提是同意短语已调整以反映此长期上下文。

为了促进采用,Hugging Face 已发布一个示例 Space 和伴随的模块化代码,以便开发者将这些同意门控集成到自己的项目中。

Sources