OpenAI gpt-realtime 與 Realtime API 正式上線
OpenAI 宣佈 Realtime API 正式上線,並發布 gpt-realtime,這是一款為生產級語音代理設計的新型語音對語音模型。此更新原生支援圖像輸入、遠端模型上下文協定(MCP)伺服器,以及用於電話網路整合的會話啟始協定(SIP),大幅擴展了語音 AI 代理的應用範圍。
gpt-realtime 模型
gpt-realtime 是一款原生語音對語音模型,直接處理與產生音訊,免除獨立的語音轉文字與文字轉語音管線。此架構降低延遲,並保留人類語音的細微差異。
音訊品質與表現力
模型經過訓練,可產生更自然的語調、情感與節奏。它能遵循細緻的風格指示,例如以「法式口音且具同理心」或「快速且專業」的方式說話。OpenAI 推出了兩個全新專屬語音 Cedar 與 Marin,並更新了既有的八種語音,以利用這些品質提升。
智慧與推理
gpt-realtime 展示了對原生音訊與非語言線索(如笑聲)的理解提升。它能在句子中途切換語言,並更精確地偵測西班牙語、中文、日文與法文中的字母數字序列(例如電話號碼或 VIN)。
在推理方面,模型在 Big Bench Audio 基準測試中取得 82.8% 的正確率,較 2024 年 12 月的模型的 65.6% 有顯著提升。
指令遵循與函式呼叫
指令遵循的改進使模型能更嚴格地依照開發者提示執行,例如逐字朗讀免責聲明腳本。在 MultiChallenge 音訊基準測試中,gpt-realtime 獲得 30.5% 的分數,高於前一代模型的 20.6%。
函式呼叫能力在三個面向得到加強:呼叫函式的相關性、呼叫時機以及參數的正確性。在 ComplexFuncBench 音訊評估中,gpt-realtime 獲得 66.5% 的分數,較前一代模型的 49.7% 有明顯提升。此外,模型現在原生支援非同步函式呼叫,使對話在等待長時間執行工具結果時仍保持流暢。
Realtime API 功能更新
Beyond the model update, the Realtime API introduces several production-oriented features:
- 遠端 MCP 伺服器支援: 開發者可在會話設定中提供遠端 MCP 伺服器 URL,以啟用模型上下文協定(MCP)支援,讓 API 能自動處理工具呼叫,無需手動整合。
- 圖像輸入: 模型現在可同時處理圖像、照片與螢幕截圖,與音訊或文字一起使用。這讓代理能以視覺情境作為對話基礎,使用者可詢問模型在共享圖像中「看到」的內容。
- SIP 支援: 直接支援會話啟始協定(SIP),讓開發者能將語音代理連接至公共電話網路、PBX 系統與桌上電話。
- 可重複使用的提示: 開發者現在可以儲存並在不同的 Realtime API 會話間重複使用提示,包括工具、變數與範例訊息。
安全、隱私與定價
為防止濫用,OpenAI 使用主動分類器監控會話,並可中止違反有害內容指引的對話。建議開發者使用 Agents SDK 以增設防護。使用政策要求開發者在與 AI 互動時向使用者說明,且禁止將服務用於垃圾訊息或欺騙行為。
定價與可用性
gpt-realtime 已立即向所有開發者開放。相較於 gpt-4o-realtime-preview,定價降低了 20%:
- 音訊輸入: 每 100 萬 token $32(快取輸入 token 每 0.40 美元)。
- 音訊輸出: 每 100 萬 token $64。
開發者現在可對對話上下文進行細緻控制,設定 token 上限並截斷回合,以在長時間會話中管理成本。