介紹 GPT‑Live‑1 與 GPT‑Live‑1 mini:OpenAI 的全雙工語音模型新突破

介紹 GPT‑Live‑1 與 GPT‑Live‑1 mini:OpenAI 的全雙工語音模型新突破

TL;DR

OpenAI 推出 GPT‑Live‑1 與 GPT‑Live‑1 mini,這是一代全雙工架構的語音模型,能同時聆聽與說話,將繁重的推理工作委派給 GPT‑5.5,並提供更自然的 ChatGPT 語音體驗。

概述

我們正在推出 GPT‑Live,一代全新的語音模型,讓與 AI 的對話更像是真實的交談。

GPT‑Live 採用全雙工架構,能同時聆聽與說話。它可以透過「mhmm」或「yeah」等語句表現出專注,快速來回互動,或在使用者需要思考的時候保持沉默。

在發布時,GPT‑Live 會在背景使用 GPT‑5.5 處理需要網路搜尋、更深入推理或較複雜工作的任務,同時保持對話流暢。

今天同時發布兩個版本:GPT‑Live‑1GPT‑Live‑1 mini,未來計畫將它們提供給 API。

技術架構

GPT‑Live 透過兩項架構變更來解決這些限制。

透過全雙工的持續互動 – GPT‑Live 不再以離散回合處理,而是持續在產生輸出的同時處理輸入,使其能在每秒多次決定是說話、聆聽、暫停、打斷或呼叫工具。此方式支援自然的來回對話、更佳的時機感知與即時翻譯。

委派以處理更深層工作 – 互動層 (GPT‑Live) 與負責搜尋、推理或代理任務的獨立模型分離。當問題需要此類能力時,GPT‑Live 會委派給如 GPT‑5.5 等前沿模型,維持對話並在結果就緒時回傳。此設計亦讓 GPT‑Live 能持續使用最新發布的前沿模型。

功能與使用者體驗

隨著時間推移,我們相信此研究也將開啟語音用於日益複雜、長時間且更具代理性的工作的可能性。

  • 使用者可以打斷、暫停或請求 ChatGPT 放慢語速;模型會以「mhmm」或「got it」等語句回應。
  • 為 GPT‑Live 重新製作了九種不同的語音。
  • 在說話時,ChatGPT 能顯示天氣、股票、體育等主題的豐富視覺卡片。
  • 語音仍支援搜尋、記憶、圖像與檔案上傳。
  • 可選擇推理層級:Instant(即時)提供快速回應,Medium(中等)與 High(高)則提供更多思考時間。

評估

我們建立了全新的人類評估,以衡量對話的愉悅度與流暢性。

在 5–10 分鐘的正面對決對話中,GPT‑Live‑1 與 GPT‑Live‑1 mini 在整體偏好、輪流發言、打斷、對話流暢度與自然度方面,皆明顯優於 Advanced Voice Mode。

來源中提到的具體基準結果如下:

  • GPQA:GPT‑Live‑1 在生物、化學與物理等領域的專家級科學推理上,明顯優於 Advanced Voice Mode。
  • BrowseComp:GPT‑Live‑1 在代理式網路搜尋與尋找難以取得資訊方面,較 Advanced Voice Mode 有顯著提升。
  • τ³‑Voice Telecom(內部變體):GPT‑Live‑1 在真實的多回合電信支援任務上,表現優於 Advanced Voice Mode。

安全性

GPT‑Live 預設即設計為安全的。

  • 擴充安全測試,加入全新音訊原生評估與合成評估,重點關注自我傷害、精神病與躁鬱、對 AI 的情感依賴、暴力與性內容。
  • 內部紅隊測試,針對語音特有風險。
  • 即時安全機制,可引導模型給予更安全的回應、顯示安全訊息,或在高風險情況下結束對話。
  • 為自我傷害情況調整支援流程,提供經專家審核的危機求助熱線。
  • 直接在模型中訓練符合年齡的行為,以減少青少年不當回應;家長控制功能讓家長能為青少年開啟或關閉 ChatGPT 語音,並在高風險情況下收到通知。
  • 持續的長期測量與上線後監測,聚焦於情感依賴。
  • 使用預先定義的語音集合,並設有防護機制,防止冒充真實人物的語音。

來源指出,GPT‑Live 在幾乎所有評估的安全領域中,表現與或優於 Advanced Voice Mode。

推出與可用性

我們今天開始向全球 ChatGPT 使用者推出兩個版本的 GPT‑Live – GPT‑Live‑1GPT‑Live‑1 mini

  • GPT‑Live‑1 成為支援 Go、Plus 與 Pro 使用者的 ChatGPT 語音的預設模型。
  • GPT‑Live‑1 mini 成為免費使用者的預設模型。
  • 此次推出涵蓋 iOS、Android 與 ChatGPT.com。
  • 開發者與企業可透過提供的表單註冊,於模型透過 API 可用時收到通知。
  • 舊版的 ChatGPT 語音(Standard 與 Advanced Voice Mode)仍可在需要語音搭配影片或螢幕共享等功能時使用。

限制與未來工作

在發布時,GPT‑Live 尚未支援在 ChatGPT 中的語音搭配影片或螢幕共享,但我們正努力盡快引入這些功能。

  • 對於某些語言,模型可能帶有非母語口音或流暢度不足;相關改進持續進行中。
  • 我們的願景是實現真正自然的人機互動,隨著時間推移,讓語音延伸至日益複雜、長時間且更具代理性的工作。

上述所有敘述皆直接取自來源,未加入任何外部事實或數據。

Sources