OpenAI GPT-4o 版本說明
OpenAI 推出了 GPT-4o(「omni」),一款多模態模型,旨在實現更自然的人機互動。透過單一神經網路處理文字、音訊、影像與影片輸入,並產生文字、音訊與影像輸出,GPT-4o 能達到與人類對話相似的回應時間。
端到端多模態架構
GPT-4o 用單一端到端神經網路取代了先前在語音模式中使用的多模型管線。過去,語音模式依賴三個獨立模型:一個用於音訊轉文字的轉錄模型、一個用於文字處理(GPT-3.5 或 GPT-4)的模型,以及一個將文字轉為音訊的模型。此管線導致大量資訊遺失,因為核心智慧模型無法直接觀測語調、背景噪音或多位說話者,也無法輸出情感、歌唱或笑聲。
透過在文字、視覺與音訊上訓練單一模型,GPT-4o 在同一網路內處理所有輸入與輸出,消除了與分離模型相關的管線延遲與資訊遺失。
效能與延遲
GPT-4o 在英文文字與程式碼的效能上與 GPT-4 Turbo 相當,同時在非英文語言處理、視覺與音訊理解方面提供顯著提升。
回應速度
GPT-4o 能在最短 232 毫秒內回應音訊輸入,平均為 320 毫秒。與先前的語音模式相比,延遲大幅降低,後者在 GPT-3.5 時平均為 2.8 秒,GPT-4 時為 5.4 秒。
多語言分詞
GPT-4o 採用全新分詞器,顯著提升各語系的壓縮率。以下為代幣減少的範例:
- Gujarati:減少 4.4 倍代幣
- Telugu:減少 3.5 倍代幣
- Tamil:減少 3.3 倍代幣
- Marathi:減少 2.9 倍代幣
- Hindi:減少 2.9 倍代幣
- Arabic:減少 2.0 倍代幣
- Russian:減少 1.7 倍代幣
- Korean:減少 1.7 倍代幣
- Chinese:減少 1.4 倍代幣
- Japanese:減少 1.4 倍代幣
- English:減少 1.1 倍代幣
安全性與風險評估
GPT-4o 透過訓練資料過濾與訓練後行為微調,將安全性內建於設計中。OpenAI 為語音輸出實施了全新安全系統,並與超過 70 位在錯資訊、偏見與社會心理等領域的專家進行外部紅隊測試。
風險評分卡
根據 OpenAI 的備援框架,GPT-4o 在任何類別的風險評分皆未超過「中等」風險。以下為緩解前後的風險等級:
| 類別 | 緩解前風險 | 緩解後風險 |
|---|---|---|
| 網路安全 | 低 | 低 |
| CBRN | 低 | 低 |
| 說服 | 中 | 中 |
| 模型自治 | 低 | 低 |
可用性與 API 定價
GPT-4o 在 ChatGPT 中對免費與 Plus 用戶皆可使用,Plus 用戶的訊息上限最高可提升 5 倍。對開發者而言,GPT-4o 以文字與視覺模型形式提供於 API,並相較於 GPT-4 Turbo 具備以下改進:
- Speed:提升 2 倍速度
- Cost:成本降低 50%(價格減半)
- Rate Limits:速率上限提升 5 倍
音訊與影片功能將於未來數週逐步向受信任的合作夥伴與 ChatGPT Plus Alpha 用戶推出。
Sources
- OriginalHello GPT-4o