介紹 GPT‑Live‑1 與 GPT‑Live‑1 mini:OpenAI 的全雙工語音模型新突破
介紹 GPT‑Live‑1 與 GPT‑Live‑1 mini:OpenAI 的全雙工語音模型新突破
TL;DR
OpenAI 推出 GPT‑Live‑1 與 GPT‑Live‑1 mini,這是一代全雙工架構的語音模型,能同時聆聽與說話,將繁重的推理工作委派給 GPT‑5.5,並提供更自然的 ChatGPT 語音體驗。
概述
我們正在推出 GPT‑Live,一代全新的語音模型,讓與 AI 的對話更像是真實的交談。
GPT‑Live 採用全雙工架構,能同時聆聽與說話。它可以透過「mhmm」或「yeah」等語句表現出專注,快速來回互動,或在使用者需要思考的時候保持沉默。
在發布時,GPT‑Live 會在背景使用 GPT‑5.5 處理需要網路搜尋、更深入推理或較複雜工作的任務,同時保持對話流暢。
今天同時發布兩個版本:GPT‑Live‑1 與 GPT‑Live‑1 mini,未來計畫將它們提供給 API。
技術架構
GPT‑Live 透過兩項架構變更來解決這些限制。
透過全雙工的持續互動 – GPT‑Live 不再以離散回合處理,而是持續在產生輸出的同時處理輸入,使其能在每秒多次決定是說話、聆聽、暫停、打斷或呼叫工具。此方式支援自然的來回對話、更佳的時機感知與即時翻譯。
委派以處理更深層工作 – 互動層 (GPT‑Live) 與負責搜尋、推理或代理任務的獨立模型分離。當問題需要此類能力時,GPT‑Live 會委派給如 GPT‑5.5 等前沿模型,維持對話並在結果就緒時回傳。此設計亦讓 GPT‑Live 能持續使用最新發布的前沿模型。
功能與使用者體驗
隨著時間推移,我們相信此研究也將開啟語音用於日益複雜、長時間且更具代理性的工作的可能性。
- 使用者可以打斷、暫停或請求 ChatGPT 放慢語速;模型會以「mhmm」或「got it」等語句回應。
- 為 GPT‑Live 重新製作了九種不同的語音。
- 在說話時,ChatGPT 能顯示天氣、股票、體育等主題的豐富視覺卡片。
- 語音仍支援搜尋、記憶、圖像與檔案上傳。
- 可選擇推理層級:Instant(即時)提供快速回應,Medium(中等)與 High(高)則提供更多思考時間。
評估
我們建立了全新的人類評估,以衡量對話的愉悅度與流暢性。
在 5–10 分鐘的正面對決對話中,GPT‑Live‑1 與 GPT‑Live‑1 mini 在整體偏好、輪流發言、打斷、對話流暢度與自然度方面,皆明顯優於 Advanced Voice Mode。
來源中提到的具體基準結果如下:
- GPQA:GPT‑Live‑1 在生物、化學與物理等領域的專家級科學推理上,明顯優於 Advanced Voice Mode。
- BrowseComp:GPT‑Live‑1 在代理式網路搜尋與尋找難以取得資訊方面,較 Advanced Voice Mode 有顯著提升。
- τ³‑Voice Telecom(內部變體):GPT‑Live‑1 在真實的多回合電信支援任務上,表現優於 Advanced Voice Mode。
安全性
GPT‑Live 預設即設計為安全的。
- 擴充安全測試,加入全新音訊原生評估與合成評估,重點關注自我傷害、精神病與躁鬱、對 AI 的情感依賴、暴力與性內容。
- 內部紅隊測試,針對語音特有風險。
- 即時安全機制,可引導模型給予更安全的回應、顯示安全訊息,或在高風險情況下結束對話。
- 為自我傷害情況調整支援流程,提供經專家審核的危機求助熱線。
- 直接在模型中訓練符合年齡的行為,以減少青少年不當回應;家長控制功能讓家長能為青少年開啟或關閉 ChatGPT 語音,並在高風險情況下收到通知。
- 持續的長期測量與上線後監測,聚焦於情感依賴。
- 使用預先定義的語音集合,並設有防護機制,防止冒充真實人物的語音。
來源指出,GPT‑Live 在幾乎所有評估的安全領域中,表現與或優於 Advanced Voice Mode。
推出與可用性
我們今天開始向全球 ChatGPT 使用者推出兩個版本的 GPT‑Live – GPT‑Live‑1 與 GPT‑Live‑1 mini。
- GPT‑Live‑1 成為支援 Go、Plus 與 Pro 使用者的 ChatGPT 語音的預設模型。
- GPT‑Live‑1 mini 成為免費使用者的預設模型。
- 此次推出涵蓋 iOS、Android 與 ChatGPT.com。
- 開發者與企業可透過提供的表單註冊,於模型透過 API 可用時收到通知。
- 舊版的 ChatGPT 語音(Standard 與 Advanced Voice Mode)仍可在需要語音搭配影片或螢幕共享等功能時使用。
限制與未來工作
在發布時,GPT‑Live 尚未支援在 ChatGPT 中的語音搭配影片或螢幕共享,但我們正努力盡快引入這些功能。
- 對於某些語言,模型可能帶有非母語口音或流暢度不足;相關改進持續進行中。
- 我們的願景是實現真正自然的人機互動,隨著時間推移,讓語音延伸至日益複雜、長時間且更具代理性的工作。
上述所有敘述皆直接取自來源,未加入任何外部事實或數據。
Sources
- OriginalIntroducing GPT-Live