ChatGPT 語音與圖像功能更新

OpenAI 已將語音與圖像功能整合到 ChatGPT 中,將介面從純文字轉變為多模態體驗。此更新允許用戶進行即時語音對話,並提供視覺輸入供模型分析與討論。

語音互動功能

ChatGPT 現在支援來回語音對話,讓用戶能夠免手操作與助理互動。此功能可透過 iOS 與 Android 上「New Features」選單中的選擇加入設定使用。

語音技術實作

語音體驗由兩項主要技術的組合驅動:

  • 文字轉語音 (TTS): 一種能夠從文字和幾秒樣本語音生成類人音頻的新模型。可用的聲音是與專業配音員合作創建的。
  • 語音辨識: OpenAI 的開源 Whisper 系統用於將口語轉錄為文字,供模型處理。

圖像理解與視覺輸入

用戶現在可以提供一張或多張圖片給 ChatGPT,以執行例如硬體故障排除、根據儲藏室內容規劃餐點,或分析複雜的資料圖表等任務。在行動裝置上,提供繪圖工具以協助用戶將模型的注意力集中在圖像的特定部分。

多模態模型架構

圖像理解由 GPT-3.5 和 GPT-4 的多模態版本提供動力。這些模型將語言推理能力應用於各種視覺格式,包括照片、螢幕截圖以及結合文字與圖像的文件。

安全與部署策略

OpenAI 將在兩週內逐步向 Plus 和 Enterprise 使用者部署這些功能,之後計畫擴大對開發者和其他使用者群體的存取。此階段性推出旨在完善風險緩解措施,並為使用者做好迎接更強大系統的準備。

語音安全與風險緩解

由於創造逼真的合成聲音的能力可能被用於冒充或詐騙,OpenAI 已將該技術的應用限制在特定使用案例:使用由專業演員創建的聲音進行語音聊天。在 ChatGPT 外部,OpenAI 正與 Spotify 等合作夥伴合作,為播客試點語音翻譯功能。

視覺安全與隱私

為應對與人物相關的幻覺或在高風險領域的濫用等風險,OpenAI 採取了以下措施:

  • 紅隊測試: 模型經紅隊測試者和 Alpha 測試者測試,以評估與科學專業能力和極端主義相關的風險。
  • 隱私限制: 已實施技術措施,顯著限制 ChatGPT 分析並對人物發表直接陳述的能力,以保護隱私並確保準確性。
  • 無障礙合作: 視覺功能的開發參考了與 Be My Eyes(一款為盲人和低視力者設計的應用程式)的合作成果。

模型限制

OpenAI 指出視覺能力具體限制如下:

  • 需驗證: 建議用戶在未進行適當驗證的情況下,不要將模型用於高風險使用案例。
  • 語言限制: 雖然模型在轉錄英文文字方面表現熟練,但對其他語言(尤其是使用非羅馬字母的語言)的表現較差。

Sources