Hugging Face Voice Cloning with Consent
Hugging Face 推出了“语音同意门控”,这是一个技术框架,旨在确保语音克隆仅在说话者提供明确的录制同意后才发生。此方法将同意这一抽象伦理原则转化为系统功能的前置条件,防止模型在未获得用户主动许可的情况下生成用户声音的合成语音。
同意即系统基础设施
语音同意门控通过将模型的激活依赖于特定同意短语的识别,将伦理原则直接嵌入到 AI 工作流中。这创造了一个可追溯且可审计的交互,其中明确的同意行为是系统运行的强制条件。通过默认设计系统以尊重自主权,透明度和同意成为功能需求,而不仅仅是声明性陈述。
语音同意门控的技术实现
一个带有同意门控的基本语音克隆系统需要三个主要组件:
- 同意句子生成:一种方法,为说话者创建新颖的句子供其朗读,这些句子唯一地引用当前的同意上下文。
- 自动语音识别 (ASR):一个系统,用于识别说话者的句子以验证同意。
- 语音克隆文本转语音 (TTS):一个系统,使用说话者的语音片段生成新的音频。
同意与克隆过程
Hugging Face 观察到,现代语音克隆系统可以仅使用单个句子生成语音,因此用于验证同意的句子同时也可以作为克隆过程的技术输入。
同意机制 为了确保同意是知情且特定于上下文的,系统会生成一个简短的英文话语(大约 20 词),其中包含特定的同意短语以及正在使用的模型名称(例如:“我同意使用 < MODEL > 语音克隆模型并使用我的声音”)。为了最小化使用被操纵或预先存在的录音的风险,系统建议:
- 使用直接麦克风输入而不是文件上传。
- 生成新颖且之前未说过的句子以索引当前会话。
确保技术质量 为了获得高质量的合成,输入音频必须具备语音多样性、中性或礼貌的语调,以及清晰的开始和结束。为此,语言模型为每个用户生成句子对:
- 一句表达明确同意的句子。
- 一句关于随机日常话题(例如天气、食物或音乐)的中性句子,以提供有效克隆所需的多样元音和辅音。
示例生成的短语包括:“我同意今天使用我的声音通过 Chatterbox 模型生成合成音频。我的日常通勤大多数日子都是步行穿越拥挤的街道。”
解锁语音克隆系统
一旦 ASR 系统验证说话者的输入与生成的文本匹配,语音克隆系统将被解锁。Hugging Face 为此工作流程提供了几种实现选项:
- 直接激活:同意音频直接用作语音克隆模型的种子,以生成任意文本。
- 外部文件同意:可以修改系统,以允许说话者同意使用各种其他上传的语音文件(例如在线录音)。
- 持久同意:同意音频可以通过
huggingface_hub上传功能保存,以便在系统中未来使用,前提是同意短语已调整以反映此长期上下文。
为了促进采用,Hugging Face 已发布一个示例 Space 和伴随的模块化代码,以便开发者将这些同意门控集成到自己的项目中。
Sources
- OriginalVoice Cloning with Consent