OpenAI GPT-4o 版本說明

OpenAI 推出了 GPT-4o(「omni」),一款多模態模型,旨在實現更自然的人機互動。透過單一神經網路處理文字、音訊、影像與影片輸入,並產生文字、音訊與影像輸出,GPT-4o 能達到與人類對話相似的回應時間。

端到端多模態架構

GPT-4o 用單一端到端神經網路取代了先前在語音模式中使用的多模型管線。過去,語音模式依賴三個獨立模型:一個用於音訊轉文字的轉錄模型、一個用於文字處理(GPT-3.5 或 GPT-4)的模型,以及一個將文字轉為音訊的模型。此管線導致大量資訊遺失,因為核心智慧模型無法直接觀測語調、背景噪音或多位說話者,也無法輸出情感、歌唱或笑聲。

透過在文字、視覺與音訊上訓練單一模型,GPT-4o 在同一網路內處理所有輸入與輸出,消除了與分離模型相關的管線延遲與資訊遺失。

效能與延遲

GPT-4o 在英文文字與程式碼的效能上與 GPT-4 Turbo 相當,同時在非英文語言處理、視覺與音訊理解方面提供顯著提升。

回應速度

GPT-4o 能在最短 232 毫秒內回應音訊輸入,平均為 320 毫秒。與先前的語音模式相比,延遲大幅降低,後者在 GPT-3.5 時平均為 2.8 秒,GPT-4 時為 5.4 秒。

多語言分詞

GPT-4o 採用全新分詞器,顯著提升各語系的壓縮率。以下為代幣減少的範例:

  • Gujarati:減少 4.4 倍代幣
  • Telugu:減少 3.5 倍代幣
  • Tamil:減少 3.3 倍代幣
  • Marathi:減少 2.9 倍代幣
  • Hindi:減少 2.9 倍代幣
  • Arabic:減少 2.0 倍代幣
  • Russian:減少 1.7 倍代幣
  • Korean:減少 1.7 倍代幣
  • Chinese:減少 1.4 倍代幣
  • Japanese:減少 1.4 倍代幣
  • English:減少 1.1 倍代幣

安全性與風險評估

GPT-4o 透過訓練資料過濾與訓練後行為微調,將安全性內建於設計中。OpenAI 為語音輸出實施了全新安全系統,並與超過 70 位在錯資訊、偏見與社會心理等領域的專家進行外部紅隊測試。

風險評分卡

根據 OpenAI 的備援框架,GPT-4o 在任何類別的風險評分皆未超過「中等」風險。以下為緩解前後的風險等級:

類別 緩解前風險 緩解後風險
網路安全
CBRN
說服
模型自治

可用性與 API 定價

GPT-4o 在 ChatGPT 中對免費與 Plus 用戶皆可使用,Plus 用戶的訊息上限最高可提升 5 倍。對開發者而言,GPT-4o 以文字與視覺模型形式提供於 API,並相較於 GPT-4 Turbo 具備以下改進:

  • Speed:提升 2 倍速度
  • Cost:成本降低 50%(價格減半)
  • Rate Limits:速率上限提升 5 倍

音訊與影片功能將於未來數週逐步向受信任的合作夥伴與 ChatGPT Plus Alpha 用戶推出。

Sources