OpenAI 次世代音訊模型 API 發佈
OpenAI 在其 API 中推出了一套全新的音訊模型,以促進開發更智慧且可自訂的語音代理人。這些模型帶來了最先進的語音轉文字準確度以及首個可操控的文字轉語音功能,讓開發者能根據特定指示控制模型的說話方式。
增強的語音轉文字功能
OpenAI 已推出 gpt-4o-transcribe 與 gpt-4o-mini-transcribe,其在準確度與可靠性上超越先前的 Whisper 模型。這些模型專為處理具挑戰性的音訊環境而設計,包括語速變化、噪音背景以及多樣的口音。
主要改進包括:
- 降低字詞錯誤率 (WER): 新模型在多項基準測試中達到更低的 WER,包括涵蓋超過 100 種語言的多語言 FLEURS 基準。
- 基準表現: 這些模型在所有語言評估中持續優於 Whisper v2 與 Whisper v3。
- 使用情境最佳化: 提升的轉錄可靠性使這些模型在會議記錄轉錄與客戶服務中心等情境中特別有效。
可操控的文字轉語音
全新的 gpt-4o-mini-tts 模型引入了可操控性,讓開發者能指示模型的語音傳達方式與語調。開發者首次可以提供如「以同理心的客服人員口吻說話」之類的指示,以自訂聲音的情感共鳴與風格。
此功能可支援多種客製化應用,包括敘事故事的表情化旁白與具同理心的客服互動。目前這些模型僅限於人工、預設的聲音,以確保符合合成預設。
技術創新
次世代音訊模型基於 GPT-4o 與 GPT-4o-mini 架構,並採用了多項關鍵技術進步:
預訓練與資料集
- 以音訊為中心的預訓練: 這些模型在專門的音訊資料集上進行了廣泛的預訓練,以優化效能並深入了解語音細微差異。
蒸餾方法論
- 先進的蒸餾: OpenAI 採用了增強的蒸餾技術與自我對弈方法,將大型音訊模型的知識轉移至較小且更高效的版本。此舉確保較小的模型透過模擬真實的使用者與助理互動,仍能維持高對話品質與回應速度。
強化學習
- 強化學習導向的範式: 在語音轉文字模型中,整合了以強化學習為主的方式,將轉錄準確度提升至最先進水平,特別是減少幻覺現象並提升在複雜辨識情境中的精確度。
API 可用性與整合
這些模型可透過語音轉文字與文字轉語音 API 向所有開發者提供。為簡化語音代理人的開發,OpenAI 已發布與 Agents SDK 的整合。對於需要低延遲語音對語音體驗的開發者,OpenAI 建議使用 Realtime API 中提供的語音對語音模型。
未來路線圖
OpenAI 計畫持續提升音訊模型的智慧與準確度。未來目標包括探索讓開發者自行帶入自訂聲音的方式,同時維持安全標準。此外,OpenAI 也在投資其他模態,包括影片,以支援多模態代理體驗的創建。