GPT-4.1 API 發布說明 / 最新資訊

OpenAI 已發布新系列的 API 模型——GPT-4.1、GPT-4.1 mini 和 GPT-4.1 nano,這些模型在程式編寫、指令遵循以及長上下文理解方面的表現超越 GPT-4o 和 GPT-4o mini。這些模型引入了高達 100 萬 token 的擴展上下文窗口,並將知識截止日期更新至 2024 年 6 月。

加強的程式編寫能力

  • 軟體工程表現:GPT-4.1 在 SWE-bench Verified 上取得 54.6% 的分數,較 GPT-4o 提升 21.4 個絕對百分點,較 GPT-4.5 提升 26.6 個絕對百分點。
  • 程式碼差異可靠性:該模型在 Aider 的多語言 diff 基準測試上得分超過 GPT-4o 的兩倍,且較 GPT-4.5 提高 8 個絕對百分點。這讓開發者只輸出變更的行,而不是重寫整個檔案,從而降低成本與延遲。
  • 前端開發:在正面比較中,人工評分者在 80% 的情況下更偏好 GPT-4.1 生成的網站,而非 GPT-4o 的網站。
  • 降低噪聲:內部評估顯示,程式碼的多餘編輯率從 GPT-4o 的 9% 降至 GPT-4.1 的 2%。

改進的指令遵循與可靠性

  • 基準提升:GPT-4.1 在 Scale 的 MultiChallenge 基準上取得 38.3%(較 GPT-4o 提升 10.5 個絕對百分點),在 IFEval 上取得 87.4%(相較於 GPT-4o 的 81.0%)。
  • 多輪一致性:該模型經過訓練,可更好地從先前訊息中檢索資訊,提升深度對話的一致性。
  • 實際應用:早期測試者(如 Blue J)報告稱,在具挑戰性的真實稅務情境中,準確率較 GPT-4o 提升了 53%。Hex 則報告其最具挑戰性的 SQL 評估集上提升近 2 倍。

長上下文理解與推理

  • 檢索準確度:在「大海撈針」評估中,GPT-4.1、mini 與 nano 在高達 100 萬 token 的所有位置上均能一致且準確地檢索資訊。
  • 複雜推理:為評估多跳推理,OpenAI 推出了 Graphwalks 資料集。GPT-4.1 在此基準上達到 61.7% 的準確率,與 OpenAI o1 相當,且超過 GPT-4o。
  • 多輪指代消解:OpenAI 亦開源了 OpenAI-MRCR 評估,GPT-4.1 在上下文長度最高 128K 時優於 GPT-4o,且在高達 100 萬 token 時仍保持強勁表現。
  • 企業影響:Thomson Reuters 報告稱,CoCounsel 在多文件審查準確率提升了 17%;Carlyle 則在極大且密集的文件檢索上提升了 50%。

模型系列層級與效能

  • GPT-4.1:針對最複雜任務的旗艦模型,提供最高的智慧與最大的上下文窗口。
  • GPT-4.1 mini:高效能模型,在智慧評估上與 GPT-4o 相當或更佳,同時將延遲降低近一半,成本降低 83%。
  • GPT-4.1 nano:最快且最便宜的模型,在 MMLU 上取得 80.1% 的分數,在 GPQA 上取得 50.3%。此模型針對低延遲任務(如分類與自動完成)進行了最佳化。

視覺與多模態能力

GPT-4.1 提供先進的影像理解能力,GPT-4.1 mini 常在影像基準測試中勝過 GPT-4o。該模型亦在長影片理解上創下新紀錄,在 Video-MME(長影片、無字幕)類別中取得 72.0% 的分數,較 GPT-4o 提升 6.7 個絕對百分點。

定價與可用性

GPT-4.1 系列模型可透過 API 使用。GPT-4.5 預覽版將於 2025 年 7 月 14 日停止支援。

模型 輸入(每 1M) 快取輸入(每 1M) 輸出(每 1M) 混合定價
GPT-4.1 $2.00 $0.50 $8.00 $1.84
GPT-4.1 mini $0.40 $0.10 $1.60 $0.42
GPT-4.1 nano $0.10 $0.025 $0.40 $0.12

關鍵定價更新:

  • 提示快取:重複上下文的折扣已提升至 75%(原為 50%)。
  • 長上下文:高達 100 萬 token 的請求不會產生額外費用,僅收取標準的每 token 費率。
  • 批次 API:透過 Batch API 使用可享有 50% 折扣。

Sources