GPT-4o 視覺微調 API 發佈
OpenAI 推出了 GPT-4o 的視覺微調功能,使開發者能夠同時使用圖像與文字來自訂模型。此功能可在僅使用文字微調不足以應對的專業視覺任務上帶來顯著提升,例如強化的視覺搜尋、自動駕駛車輛物件偵測與醫學影像分析。
視覺微調的技術實作
GPT-4o 的視覺微調遵循與文字微調類似的流程。開發者需以特定格式準備圖像資料集,並上傳至 OpenAI 平台。
主要技術細節包括:
- 資料需求:即使僅有 100 張圖像也能提升效能,然而更大量的文字與圖像資料可帶來更高的效能提升。
- 模型支援:此功能支援
gpt-4o-2024-08-06模型快照。 - 輸入格式:資料集採用 JSON 結構,訊息可同時包含文字與
image_url類型,與 OpenAI Chat 端點使用的格式相同。
真實世界的效能提升
與早期合作夥伴的合作顯示,視覺微調在多個領域相較於基礎 GPT-4o 模型可帶來顯著的效能提升:
地圖與基礎建設(Grab)
Grab 使用 100 個範例教導 GPT-4o 定位交通標誌與計算車道分隔線,結果如下:
- 車道計數準確度提升 20%。
- 限速標誌定位提升 13%。
企業自動化(Automat)
Automat 利用螢幕截圖與非結構化文件來提升 RPA(機器人流程自動化)代理人的效能:
- 使用者介面元素定位:透過以自然語言描述訓練模型定位 UI 元素,成功率從 16.60% 提升至 61.67%(提升 272%)。
- 資訊抽取:在 200 張非結構化保險文件圖像上訓練,使 F1 分數提升 7%。
數位內容創作(Coframe)
Coframe 以圖像與程式碼微調 GPT-4o,以產生品牌化的網站區塊。此方法使模型在保持一致的視覺風格與正確版面配置方面較基礎模型提升了 26%。
安全、隱私與資料控制
視覺微調受 OpenAI 企業隱私承諾的管控。主要保護措施包括:
- 資料所有權:微調後的模型仍由開發者掌控,且開發者保有其業務資料的完整所有權。
- 訓練限制:未經明確授權,OpenAI 不會使用視覺微調服務的輸入或輸出資料來訓練其基礎模型。
- 監控:OpenAI 會使用自動化安全評估並監控使用情況,以確保遵守使用政策。
可用性與定價
視覺微調在付費使用層級向所有開發者開放。
定價結構(2024 年 10 月 31 日之後)
- 訓練:每 1 百萬 token $25。
- 推論(輸入):每 1 百萬 token $3.75。
- 推論(輸出):每 1 百萬 token $15。
圖像輸入會依圖像大小進行 token 化,且其每 token 價格與文字輸入相同。請注意,OpenAI 在 2024 年 10 月 31 日之前每日提供 1 百萬免費訓練 token。
SUMMARY: OpenAI 推出了 GPT-4o 的視覺微調功能,讓開發者能夠使用圖文資料集自訂模型,以提升專業的視覺理解與物件偵測能力。
TITLE: GPT-4o 視覺微調 API 發佈