OpenAI 語音引擎:合成語音功能與安全框架

語音引擎技術能力

語音引擎能夠從極少量資料創造具情感且逼真的合成語音。模型只需一段 15 秒的音訊樣本與文字輸入,即可產生與原說話者高度相似的語音。

此技術於 2022 年底開發,已為 OpenAI 文字轉語音 API 中的預設語音,以及 ChatGPT 的語音與朗讀功能提供動力。模型的一項關鍵技術特點是能在翻譯過程中保留原說話者的母語口音;例如,使用法語說話者的音訊樣本生成英文語音,會產生帶有法語口音的英文。

早期應用與使用案例

OpenAI 目前正與少數合作夥伴測試語音引擎,以探索在各領域的高影響力應用:

教育與無障礙

  • 閱讀協助: Age of Learning 使用此模型產生預先腳本的配音內容以及即時、個人化的回應,為學生提供比標準預設選項更廣泛的情感語音。
  • 非語言溝通: Livox 將語音引擎整合至增強與替代溝通(AAC)裝置,使非語言者能使用獨特且非機械化的聲音,且在多種語言間保持一致。

全球覆蓋與翻譯

  • 內容翻譯: HeyGen 利用此模型進行影片翻譯,使創作者能將自己的聲音翻譯成多種語言,同時保留原有的聲音特徵。
  • 關鍵服務提供: Dimagi 結合語音引擎與 GPT-4,為社區健康工作者提供以主要語言(包括斯瓦希里語與 Sheng——肯亞的一種混合語言)進行的互動回饋。

醫療復原

  • 語音復原: Lifespan 的 Norman Prince 神經科學研究所正試點此技術,以協助語言障礙患者。曾有案例,醫師利用患者先前學校專案的 15 秒剪輯,為因血管性腦腫瘤失去流暢語言的患者恢復聲音。

安全框架與部署防護措施

鑑於可能的冒充與欺騙風險,OpenAI 為目前的預覽實施了嚴格的安全框架:

  • 同意與政策: 合作夥伴必須遵守使用政策,禁止未經同意冒充個人或組織。必須取得原說話者的明確且知情同意。
  • 開發者限制: 禁止開發者打造允許個別使用者自行創建聲音的工具。
  • 透明度: 所有 AI 生成的語音必須向受眾明確說明。
  • 技術防護: OpenAI 已實施水印技術以追蹤生成音訊的來源,並採取主動監控使用情況。

OpenAI 建議未來的大規模部署應納入語音驗證,以確認原說話者身分,並設置「禁用語音清單」以防止複製知名人物的聲音。

社會影響與建議

OpenAI 目前尚未廣泛釋出語音引擎,理由是需要加強社會對於具說服力的生成模型的韌性。實驗室建議以下系統性變革:

  • 安全更新: 逐步淘汰以語音為基礎的驗證,用於存取銀行帳戶及其他敏感資料。
  • 政策制定: 制定政策以保護個人聲音在 AI 中的合法使用。
  • 公共教育: 提升大眾對 AI 能力與限制的認識,特別是欺騙性內容的風險。
  • 來源追蹤: 加速採用技術以追蹤視聽內容的來源,辨別真實人類與 AI。

Sources