OpenAI 即時 API 發佈
OpenAI 即時 API 發佈 OpenAI 已在公開測試中推出即時 API,使開發者能夠使用 GPT-4o 建構低延遲、多模態的語音對語音體驗。
OpenAI 即時 API 發佈
OpenAI 已在公開測試中推出即時 API,允許付費開發者將低延遲、多模態的語音對語音對話整合到其應用程式中。此 API 消除了為轉錄、推理和語音合成而串接多個模型的需求,僅透過一次 API 呼叫即可實現自然的對話體驗。
技術架構與工作流程
即時 API 取代了傳統的三步管線——透過 Whisper 等模型的自動語音辨識 (ASR)、用於推理的文字型大型語言模型,以及文字轉語音 (TTS) 模型——改為直接串流方式。透過直接串流音訊輸入與輸出,API 可降低延遲,並保留在文字轉錄中通常會遺失的情感細微差別、重音與口音。
主要技術特性包括:
- 持久的 WebSocket 連線:此 API 使用 WebSocket 與 GPT-4o 實時交換訊息。
- 自動中斷處理:系統能自動處理使用者的中斷,類似 ChatGPT 的進階語音模式行為。
- 函式呼叫:此 API 支援函式呼叫,讓語音助理能觸發外部動作或取得即時情境,例如下單或存取客戶資料。
模型可用性與 API 選項
OpenAI 提供兩條不同的音訊整合路徑,視應用程式的延遲需求而定:
- 即時 API:由
gpt-4o-realtime-preview模型提供支援,旨在實現高速、自然的對話。 - 聊天完成 API:由
gpt-4o-audio-preview模型提供支援,允許開發者傳入文字或音訊,並以文字、音訊或兩者同時回應。此方案適用於不需要即時 API 那種極低延遲的使用情境。
定價與代幣化
即時 API 與聊天完成的音訊功能皆採用基於文字與音訊代幣的統一定價結構。
| 輸入類型 | 每百萬代幣價格 | 每分鐘預估成本 |
|---|---|---|
| Text Input | $5.00 | N/A |
| Text Output | $20.00 | N/A |
| Audio Input | $100.00 | ~$0.06 |
| Audio Output | $200.00 | ~$0.24 |
此外,對文字與音訊輸入提供快取定價,將成本降至每百萬快取文字輸入代幣 $2.50 與每百萬快取音訊輸入代幣 $20。
安全、隱私與合規
即時 API 基於與 ChatGPT 進階語音模式相同的 GPT-4o 版本,並納入相同的音訊安全基礎設施。安全措施包括:
- 自動監控:持續監控並由人工審查被標記的輸入與輸出,以減少濫用。
- uma 準備框架:根據 OpenAI 的準備框架進行評估,詳見 GPT-4o 系統卡。
- 紅隊測試:外部紅隊測試確認此 API 未在現有緩解措施之外引入高風險漏洞。
- 隱私承諾:根據企業隱私承諾,OpenAI 不會在未取得明確許可的情況下,以此服務的輸入或輸出作為模型訓練資料。
整合與生態系統
為了促進部署,OpenAI 與多家基礎設施合作夥伴合作:
- LiveKit 與 Agora:提供音訊元件的客戶端函式庫,如聲音隔離、回音消除與重新連線。
- Twilio:將即時 API 與 Twilio 的語音 API 整合,使 AI 代理人能透過傳統語音通話與客戶連結。
未來路線圖
OpenAI 計畫在即時 API 向一般可用性邁進的過程中擴充其功能,包括:
- 額外模態:未來支援視覺與影片。
- 提升速率限制:將同時會話上限擴展至超過目前 Tier 5 的 100 個會話。
- 官方 SDK 支援:整合至官方 OpenAI Python 與 Node.js SDK。
- 擴充模型支援:將 GPT-4o mini 整合至即將推出的模型版本。
Sources
- OriginalIntroducing the Realtime API