ChatGPT 語音與圖像功能更新
OpenAI 已將語音與圖像功能整合到 ChatGPT 中,將介面從純文字轉變為多模態體驗。此更新允許用戶進行即時語音對話,並提供視覺輸入供模型分析與討論。
語音互動功能
ChatGPT 現在支援來回語音對話,讓用戶能夠免手操作與助理互動。此功能可透過 iOS 與 Android 上「New Features」選單中的選擇加入設定使用。
語音技術實作
語音體驗由兩項主要技術的組合驅動:
- 文字轉語音 (TTS): 一種能夠從文字和幾秒樣本語音生成類人音頻的新模型。可用的聲音是與專業配音員合作創建的。
- 語音辨識: OpenAI 的開源 Whisper 系統用於將口語轉錄為文字,供模型處理。
圖像理解與視覺輸入
用戶現在可以提供一張或多張圖片給 ChatGPT,以執行例如硬體故障排除、根據儲藏室內容規劃餐點,或分析複雜的資料圖表等任務。在行動裝置上,提供繪圖工具以協助用戶將模型的注意力集中在圖像的特定部分。
多模態模型架構
圖像理解由 GPT-3.5 和 GPT-4 的多模態版本提供動力。這些模型將語言推理能力應用於各種視覺格式,包括照片、螢幕截圖以及結合文字與圖像的文件。
安全與部署策略
OpenAI 將在兩週內逐步向 Plus 和 Enterprise 使用者部署這些功能,之後計畫擴大對開發者和其他使用者群體的存取。此階段性推出旨在完善風險緩解措施,並為使用者做好迎接更強大系統的準備。
語音安全與風險緩解
由於創造逼真的合成聲音的能力可能被用於冒充或詐騙,OpenAI 已將該技術的應用限制在特定使用案例:使用由專業演員創建的聲音進行語音聊天。在 ChatGPT 外部,OpenAI 正與 Spotify 等合作夥伴合作,為播客試點語音翻譯功能。
視覺安全與隱私
為應對與人物相關的幻覺或在高風險領域的濫用等風險,OpenAI 採取了以下措施:
- 紅隊測試: 模型經紅隊測試者和 Alpha 測試者測試,以評估與科學專業能力和極端主義相關的風險。
- 隱私限制: 已實施技術措施,顯著限制 ChatGPT 分析並對人物發表直接陳述的能力,以保護隱私並確保準確性。
- 無障礙合作: 視覺功能的開發參考了與 Be My Eyes(一款為盲人和低視力者設計的應用程式)的合作成果。
模型限制
OpenAI 指出視覺能力具體限制如下:
- 需驗證: 建議用戶在未進行適當驗證的情況下,不要將模型用於高風險使用案例。
- 語言限制: 雖然模型在轉錄英文文字方面表現熟練,但對其他語言(尤其是使用非羅馬字母的語言)的表現較差。