xAI 自訂語音發布
xAI 已推出 自訂語音 功能,讓使用者僅需幾秒鐘的音訊即可克隆自己的聲音,並立即整合至 Grok 文字轉語音 (TTS) 與語音代理 API。這讓開發者與創作者能以個人化、品牌一致或保留身份特徵的語音模型,取代原本的通用預設設定。
快速語音克隆與整合
使用者僅需在 xAI 控制台內錄製約一分鐘的自然語音,即可在兩分鐘內建立可用於生產環境的語音模型。建立完成後,這些自訂語音完全相容於現有的 Grok 音訊功能,包括:
- 語音標籤: 支援對語音表達的細微控制。
- 多語言輸出: 能夠產生多種語言的語音。
- 串流支援: 支援 REST 與 WebSocket 串流。
開發者只需將特定的 voice_id 傳遞至任何 TTS 端點或語音代理 API,即可實現即時對話型代理。xAI 表示,使用這些 API 時,自訂語音不另收費。
主要應用場景
自訂語音旨在支援跨不同產業的廣泛應用:
- 品牌識別: 企業可部署具有一致且易於辨識語音的客戶支援代理,以符合品牌識別。
- 內容創作: 創作者可大量製作影片旁白、播客與社群媒體貼文,無需重複手動錄音。
- 無障礙科技: 此技術可用於保存失去說話能力者原有的語音特徵。
- 多語言溝通: 組織可於多種主要語言(包括英文、西班牙文、法文、德文、中文與日文)中傳達重要演講或訊息,同時保留原始講者語音特徵。
- 娛樂產業: 遊戲開發者與作者可為對話與有聲書 narration 創建獨特的角色語音,無需頻繁使用錄音室。
語音安全與驗證
為防止未經授權的克隆與使用既有錄音,xAI 採用兩階段驗證流程:
- 密碼語句檢查: 說話者必須大聲朗讀特定的驗證語句。語音轉文字 (STT) 引擎即時轉錄並比對此語句,以確認使用者的同意與在場。
- 說話者相似度: 系統會從驗證片段與完整錄音中計算說話者嵌入向量,並進行比對,確保兩段音訊屬於同一人。
根據 xAI 所述,這些防護措施確保使用者無法從既有錄音克隆語音,或克隆他人語音。
Sources
- OriginalCustom Voices
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch