OpenAI GPT‑Live‑1 API 發布

TL;DR

OpenAI 在 API 中宣布推出 GPT‑Live‑1,這是一款全雙工語音模型,能夠同時聆聽與說話,大幅改善語音應用中的中斷處理、延遲和對話自然度。


GPT‑Live‑1 是什麼

GPT‑Live‑1 是一個單一模型,以統一架構同時執行自動語音辨識(ASR)、推理與語音合成(TTS)。它最初在 ChatGPT 中展示,現已透過 OpenAI API 提供開發者使用。

主要功能包括:

  • 同時聆聽與說話 – 模型在產生輸出語音的同時處理輸入音訊,無需使用獨立的 STT‑LLM‑TTS 流程。
  • 順暢的中斷處理 – 它同時推理輸入與輸出音訊,與傳統輪流系統相比,中斷情況減少高達 80%(根據 Speak 的早期評估)。
  • 委派至後端模型 – 深層推理與工具呼叫可交由文字模型(如 GPT‑6 Astra 或第三方模型)處理。
  • 可自訂語調、語速與風格 – 開發者可透過系統提示控制代理的語音特徵。
  • 強健的背景雜訊管理 – 模型能區分靜音與環境音,而不破壞對話流程。
  • 長時間會話的可靠性 – 在長時間互動中保持上下文,提升對話品質。
  • 電話支援 – 支援電話應用場景(如預約與客服)的全雙工代理。

架構簡化與延遲降低

傳統語音代理需將語音轉文字、推理與文字轉語音等模組串接。每次轉移都會增加延遲,並引入故障點,特別是在使用者中斷或停頓時。

GPT‑Live‑1 將此架構整合為單一模型,處理:

  1. ASR 轉錄 – 提供使用者語音的即時文字。
  2. 回合檢測 – 即使在非輪流情境下,也能識別使用者是否結束說話。
  3. 回應生成 – 在持續聆聽中產生語音回應,並即時處理中斷。
  4. 工具委派 – 將複雜查詢轉送至後端模型(例如 Luna 用於高頻任務,Astra 用於細緻推理)。

透過在背景推理時保持對話流暢,開發者可實現更低的端到端延遲與更自然的節奏。


測量出的全雙工優勢

OpenAI 內部評估顯示 GPT‑Live‑1 有顯著提升:

  • 全雙工基準 性能相比 GPT‑Realtime‑2.1 提升 30 個百分點,回合切換延遲明顯降低。
  • 搭配 GPT‑6 Astra(中等推理負荷) 時,GPT‑Live‑1 在 Tau3 指標上排名第一,該指標衡量端到端任務中前沿語音代理的智慧水平。
  • 在航空、零售、電信與銀行的語音客服基準測試中,模型在任務成功率、中斷處理與工具使用準確率的 Pass@1 分數均更高。

這些結果顯示,統一的全雙工架構在速度與任務成功率上,均優於現有的最佳模組化流程。


新增語音選項與語言覆蓋

GPT‑Live‑1 超越先前有限的即時語音選項。開發者現可從更廣泛的語調、方言與語言中選擇,起始提供受澳洲英語影響的語音。OpenAI 計畫在未來幾個月內持續增加語音與語言支援。


定價與可用性

  • 前端語音層:每分鐘 $0.05。
  • 模型今日已在 API 中可用;開發者可搭配任何符合其成本與效能需求的後端模型或工具框架使用。
  • 自訂語音存取與企業級部署可透過銷售聯絡或透過 OpenAI Presence 取得,該服務利用 GPT‑Live‑1 在企業環境中實現可信的即時語音互動。

開發者如何使用 GPT‑Live‑1

  1. 啟動會話 – 呼叫 API,自然說話,並在嘈雜環境(如咖啡廳、街頭)中測試中斷處理。
  2. 塑造代理 – 設定系統提示以調整語調、語速與對話風格。
  3. 委派推理 – 設定後端模型(如 GPT‑6 Astra)處理複雜查詢或工具呼叫。
  4. 整合至現有工作流程 – 使用提供的 ASR 轉錄與回應文字進行記錄、分析或後續處理。

客戶反饋摘要

早期使用者表示,GPT‑Live‑1 的中斷處理讓學習者在導師回應前有更多思考時間,與以往輪流系統相比,中斷減少近 80%。


總結

GPT‑Live‑1 的發布標誌著語音流程從碎片化轉向統一的全雙工模型,帶來更低延遲、更佳中斷處理與更豐富的自訂選項,為消費者與企業領域的自然語音首選應用開啟全新可能。

Sources