Hugging Face 語音克隆與同意
Hugging Face 已推出「語音同意閘門」,這是一個技術框架,旨在確保語音克隆僅在說話者提供明確的錄製同意後才發生。此方法將同意的抽象倫理原則轉化為系統功能的先決條件,防止模型在未取得使用者主動許可的情況下,以使用者的聲音生成合成語音。
同意作為系統基礎設施
語音同意閘門透過使模型的啟動依賴於特定同意語句的辨識,將倫理原則直接嵌入 AI 工作流程。這創造了一個可追蹤且可審核的互動,其中明確的同意行為是系統運行的必要條件。透過預設設計系統以尊重自主權,透明度和同意成為功能需求,而不僅僅是宣告性的聲明。
語音同意閘門的技術實作
具備同意閘門的基本語音克隆系統需要三個主要組件:
- 同意句生成:一種為說話者創建新穎句子的方法,這些句子唯一地參考當前的同意情境。
- 自動語音識別(ASR):一個用於識別說出的句子以驗證同意的系統。
- 語音克隆文字轉語音(TTS):一個使用說話者語音片段來生成新音頻的系統。
同意與克隆過程
Hugging Face 觀察到,現代語音克隆系統僅需單一句子即可生成語音,因此用於驗證同意的句子同時也可作為克隆過程的技術輸入。
同意機制 為確保同意是知情且具體情境的,系統會生成一段短的英語話語(約 20 個詞),其中包含特定的同意語句以及正在使用的模型名稱(例如:「我同意使用 < MODEL > 語音克隆模型配合我的聲音」)。為降低使用被操縱或預先錄製音檔的風險,系統建議:
- 使用直接麥克風輸入,而非檔案上傳。
- 生成新穎且之前未曾說過的句子,以索引當前會話。
確保技術品質 為了獲得高品質的合成,輸入音頻必須具備語音多樣性、中性或禮貌的語調,以及清晰的開始與結束。為達成此目標,語言模型會為每位使用者生成句子對:
- 一句表達明確同意的句子。
- 一句關於隨機日常話題(例如天氣、食物或音樂)的中性句子,以提供有效克隆所需的多樣母音和子音。
例如生成的話語包括:「我同意今天使用我的聲音透過 Chatterbox 模型生成合成音頻。我的日常通勤大多涉及步行穿越擁擠的街道。」
解鎖語音克隆系統
一旦 ASR 系統驗證說話者的輸入與生成的文本相符,語音克隆系統即被解鎖。Hugging Face 提供此工作流程的多種實作選項:
- 直接激活:同意音訊將直接用作語音克隆模型的種子,以生成任意文本。
- 外部檔案同意:系統可以進行修改,以允許說話者同意使用各種其他上傳的語音檔案(例如線上錄音)。
- 持續同意:同意音訊可以透過
huggingface_hub上傳功能保存,以便在系統中未來使用,前提是同意語句已調整以反映此長期情境。
為促進採用,Hugging Face 已發佈一個示範 Space 及其伴隨的模組化程式碼,以讓開發者能將這些同意閘門整合到他們自己的專案中。
Sources
- OriginalVoice Cloning with Consent