OpenAI DevDay 2023: GPT-4 Turbo, Assistants API 與多模態更新

OpenAI 已推出 GPT-4 Turbo,這是一個具有 128K 上下文視窗、更強大且具成本效益的模型,同時推出一個旨在簡化 AI 代理創建的新 Assistants API。這些更新在 DevDay 上宣布,顯著擴充了平台的多模態功能,並降低了開發者的定價。

GPT-4 Turbo:擴充上下文與降低成本

GPT-4 Turbo 是 GPT-4 模型的下一代版本,擁有 128K 上下文視窗,能夠在單一提示中處理超過 300 頁的文字。該模型的世界事件知識已更新至 2023 年 4 月,並可透過 gpt-4-1106-preview API 端點使用。

定價與效能

GPT-4 Turbo 相比其前身顯著更便宜。輸入標記便宜 3 倍(每 1k 標記 $0.01),輸出標記便宜 2 倍(每 1k 標記 $0.03),相較於 GPT-4。

技術增強

  • 平行函式呼叫: 開發者現在可以在單一訊息中呼叫多個函式,減少處理複雜請求所需的往返次數。
  • JSON 模式: 新的 response_format 參數確保模型生成語法正確的 JSON,提升使用 Chat Completions API 開發者的可靠性。
  • 可重複的輸出: 引入 seed 參數可允許更一致的完成,這對除錯和單元測試至關重要。
  • 對數機率: OpenAI 將很快支援返回 GPT-4 Turbo 與 GPT-3.5 Turbo 最可能輸出標記的對數機率。

已更新的 GPT-3.5 Turbo

OpenAI 發布了 GPT-3.5 Turbo 的新版本(gpt-3.5-turbo-1106),預設支援 16K 上下文視窗。內部評估顯示在格式遵循任務上提升 38%,例如生成 JSON、XML 和 YAML。

Assistants API:建構 AI 代理

Assistants API 允許開發者透過建立具備特定指令且可存取工具的專用 AI 來構建類代理體驗。主要創新是使用 持續且無限長的執行緒,這將狀態管理卸載給 OpenAI,並繞過傳統的上下文視窗限制。

整合工具

  • 代碼解釋器: 使助理能夠在沙盒環境中編寫並執行 Python 程式碼,以解決數學問題或生成圖表。
  • 檢索: 允許助理存取專有領域資料或使用者提供的文件,而無需開發者實作自己的嵌入或分塊演算法。
  • 函式呼叫: 允許助理叫用自訂定義的函式,並將回應併入其訊息中。

新增多模態功能

OpenAI 已擴充 API 以包含視覺、圖像生成和語音合成:

  • 具備視覺的 GPT-4 Turbo: 可透過 gpt-4-vision-preview 存取,這使模型能夠分析圖像、生成標題,並讀取包含圖形的文件。
  • DALL·E 3: 現在可透過 Images API (dall-e-3) 使用,允許開發者以程式方式生成帶有內建審核的圖像。
  • 文字轉語音 (TTS): 新 API 提供來自文字的類人品質語音,具有六種預設聲音和兩種變體:tts-1(針對即時優化)和 tts-1-hd(針對品質優化)。

模型客製化與微調

OpenAI 正在推出兩種模型客製化的途徑:

  1. GPT-4 微調: 正在建立一個用於 GPT-4 微調的實驗性存取計畫,儘管初步結果顯示相比 GPT-3.5,它需要更多努力才能獲得顯著收益。
  2. 自訂模型計畫: 一項針對擁有龐大專有資料集(數十億個標記)的組織的有限、高成本計畫,使其能夠與 OpenAI 研究人員合作,從預訓練階段開始訓練自訂的 GPT-4 模型。

平台基礎設施與法律保護

定價與速率限制

OpenAI 已降低平台上的價格。值得注意的是,GPT-3.5 Turbo 16K 輸入標記現在便宜 3 倍(每 1k 標記 $0.001),輸出標記便宜 2 倍(每 1k 標記 $0.002)。此外,所有付費 GPT-4 客戶的每分鐘標記限制已加倍。

版權盾牌

OpenAI 推出了「版權盾牌」,承諾在客戶因使用 ChatGPT Enterprise 和開發者平台的一般可用功能而面臨版權侵權索賠時,為其辯護並承擔法律費用。

開源版本

  • Whisper large-v3: 開源自動語音識別(ASR)模型的下一個版本,多語言效能有所提升。
  • 一致性解碼器: 一個開源的直接替換方案,用於取代 Stable Diffusion VAE 解碼器,能提升在與 Stable Diffusion 1.0+ VAE 相容的圖像中對文字、臉部和直線的渲染。

Sources