OpenAI 微調 API 改進與自訂模型計畫擴展
OpenAI 已更新其微調 API,加入了增強的開發者控制功能,並擴大了自訂模型計畫,為需要深度領域專業知識的組織提供協助微調與完全自訂訓練的模型。
新的微調 API 功能
OpenAI 為自助微調 API 引入了多項功能,讓開發者能更細緻地控制訓練工作與模型評估。這些更新旨在透過最佳化模型於特定任務的訓練方式,協助開發者降低延遲、提升準確度並減少成本。
主要技術改進包括:
- 基於 epoch 的檢查點建立:API 現在會在每個訓練 epoch 結束時自動產生一個完整的微調模型檢查點。此舉可減少重新訓練的需求,尤其在處理過度擬合時。
- 比較式 Playground:全新並排的使用者介面讓開發者能透過比較多個模型或微調快照的輸出與單一提示,進行人工評估。
- 第三方整合:已加入對第三方平台的支援,首個支援 Weights and Biases,讓開發者能將詳細的微調資料整合至現有技術堆疊中。
- 完整驗證指標:開發者現在可以對整個驗證資料集計算損失與準確率指標,而不僅依賴抽樣批次,從而提供更精確的模型品質觀察。
- 超參數設定:超參數現在可直接在儀表板上配置,無需僅使用 API 或 SDK。
- 儀表板改進:微調儀表板現在支援從先前設定重新執行工作,並可檢視更詳細的訓練指標。
案例研究:Indeed
Indeed 使用 GPT-3.5 Turbo 的微調 API 來產生個人化的工作推薦。透過微調模型以產出更高品質的說明,Indeed 將提示 token 數量減少了 80%,使其每月訊息量從不足百萬提升至約兩千萬。
擴大的自訂模型計畫
針對需求超出自助 API 的組織,OpenAI 擴大了自訂模型計畫。此計畫提供與 OpenAI 研究人員直接合作,利用先進技術為特定領域優化模型。
協助式微調
協助式微調是一項協作服務,採用超出標準 API 的技術,包括先進的超參數與各種大規模參數效率微調(PEFT)方法。此服務針對需要協助建立高效訓練資料管線、評估系統與客製化參數的組織而設計。
範例:SK Telecom
SK Telecom 與 OpenAI 合作,針對韓語電信領域微調 GPT-4。此合作帶來:
- 對話摘要品質提升 35%。
- 意圖辨識準確率提升 33%。
- 客戶滿意度分數從 3.6 提升至 4.5(滿分 5),相較於基礎 GPT-4 模型。
完全自訂訓練模型
針對擁有龐大專屬資料集(數百萬範例或數十億 token)的組織,OpenAI 提供完全自訂訓練模型。這些模型透過新穎的中期訓練與後期訓練技術,從頭開始修改模型訓練流程,以賦予模型深度領域知識。
範例:Harvey
Harvey 是一款法律 AI 工具,與 OpenAI 合作打造針對案例法的自訂訓練模型。經評估發現僅靠提示工程與 RAG 無法滿足所需的法律歷史深度,Harvey 整合了相當於 100 億 token 的資料。OpenAI 修改了訓練流程,包括領域特定的中期訓練與納入律師專家回饋。結果為:
- 事實回應提升 83%。
- 律師中有 97% 偏好自訂模型的輸出勝過 GPT-4。
平台狀態更新
截至 2026 年 5 月 8 日,OpenAI 正在逐步關閉微調平台。平台不再對新使用者開放,但現有使用者仍可在數個月內持續建立訓練工作。所有微調模型將持續可供推論使用,直至其對應的基礎模型被淘汰。