OpenAI 語音引擎:技術實作與安全框架

技術部署與產品整合

自 2023 年 9 月起,語音引擎已在三個主要產品實作中使用:

  • ChatGPT 語音模式:於 2023 年 9 月推出,此功能僅使用從真實聲音中創建的語音,這些聲音是透過自 2023 年 5 月起,結合專業配音演員、人才仲介與產業顧問的嚴選程序取得的。
  • TTS API:於 2023 年 11 月發布,此 API 提供六種預設語音。每種語音皆使用專業配音演員的 15 秒音訊樣本製作。
  • 自訂語音預覽:2024 年 3 月,OpenAI 向少數受信任合作夥伴預覽了自訂語音的功能,以探索合成語音技術的風險與機會。

安全研究與政策目標

OpenAI 採用迭代部署框架,協助政策制定者與公眾了解合成語音的風險。2022 年底開發的早期內部原型(僅使用公開與私人語音樣本進行內部測試)於 2023 年夏季起向全球政策制定者展示此技術的潛力。

透過有限的合作夥伴自訂語音功能預覽,OpenAI 旨在達成以下安全與政策目標:

  • 逐步淘汰語音驗證:減少將語音作為存取敏感資訊(如銀行帳戶)的安全措施的依賴。
  • 保護個人聲音:探索保護個人聲音在 AI 中使用的政策。
  • 公共教育:向公眾說明 AI 的能力與限制,包括可能的欺騙性內容。
  • 內容來源追溯:加速採用追蹤視聽內容來源的技術,以區分 AI 生成的音訊與真實人聲。

內部測試與對齊

語音引擎的內部原型僅用於對齊與安全研究,以提供防護措施的開發資訊。OpenAI 指出,這些早期內部測試的輸出僅保留於內部測試,未用於訓練支援其面向公眾產品的模型。

Sources