OpenAI 推出 GPT-6 Sol 和 Luna

TL;DR

OpenAI 發布了 GPT‑6 Sol 和 GPT‑6 Luna,這兩款是 GPT‑6 Astra 的成本效益更高的繼任者,與 GPT‑5.6 相比,API 價格減半,同時在專業任務、事實準確性、程式設計和電腦使用工作負載方面保持高水準表現。

GPT‑6 系列擴充概覽

OpenAI 推出了 GPT‑6 Sol 和 GPT‑6 Luna,以補足旗艦型號 GPT‑6 Astra。這三款模型採用相同的訓練方法,但 Sol 和 Luna 經過優化,可降低延遲並減少推論成本。透過快取和推論基礎設施的改進,相較於 GPT‑5.6 的促銷定價,價格降低了 50 %,讓先進的人工智慧更易於應用於日常情境。

API 定價降低

模型 輸入價格(每 M tokens) 輸出價格(每 M tokens) 相對降幅
GPT‑6 Sol $4 → $2 $20 → $10 50 % 更便宜
GPT‑6 Luna $0.20 → $0.10 $1.20 → $0.50 50 % 更便宜

價格以每 1 百萬 tokens 計價。GPT‑6 Astra 仍為需要最佳結果的使用者的頂級模型。

專業工作表現

關鍵結果

GPT‑6 Sol 在 AutomationBench 基準測試中表現優於 Claude Opus 5,但每項任務成本僅為 Opus 5 的 9 %;GPT‑6 Luna 相較於前代模型提升 5.4 個百分點,且成本降低 58 %。

詳細比較

  • AutomationBench 1.0.6 評估 AI 代理在 47 種工具上的端到端工作流程。GPT‑6 Sol(xhigh effort)得分 33.2 %,每任務成本為 $0.27,在得分與成本兩方面均超越 GPT‑6 Astra(low effort)和 Claude Opus 5(max effort)。
  • 在 Agents’ Last Exam 上,GPT‑6 Sol(max effort)達成 56.4 %,超越 Claude Opus 5,同時每任務成本降低 60 %。

事實正確性提升

GPT‑6 Sol 在 OpenAI 內部的事實正確性基準測試中,錯誤數量約為 GPT‑5.6 Sol 的一半,接近 Astra 的可靠性,但成本僅為其一小部分。GPT‑6 Luna 同樣表現顯著進步,在高努力等級下,以約百分之一的成本達到與 GPT‑5.6 Sol 相同的事實正確性。

程式設計能力與成本效率

關鍵結果

在 FrontierCode 和 DeepSWE v1.1 基準測試中,GPT‑6 Sol 提供的程式設計品質與頂級競爭對手模型相當,同時每任務成本降低高達 80 %。

基準細節

  • FrontierCode:GPT‑6 Sol 優於 GPT‑5.6 Sol,並以更低的成本達到與 Claude Fable 5.1(xhigh effort)相同的表現。
  • DeepSWE v1.1:GPT‑6 Sol(max effort)得分 68.8 %,僅比 Claude Fable 5 最佳得分低 1.1 個百分點,但每任務成本約降低 80 %。GPT‑6 Luna(max effort)得分 66.6 %,與 Claude Opus 5 和 Claude Fable 5 在中等努力等級下的表現相當,但每任務成本降低 93 %–96 %。

電腦使用表現

GPT‑6 Sol(xhigh effort)在 OSWorld 2.0 離線測試中達成 60.5 % 的得分,與 Claude Opus 5(medium effort)相當,但成本降低約 80 %。GPT‑6 Luna(max effort)超越 GPT‑5.6 Sol(medium effort),且僅使用其十分之一的成本。

增強的協作風格

Sol 和 Luna 延續了 Astra 精緻的溝通風格:說明更清晰、減少術語使用、減少無關細節,並以稍短的回答保持內容完整性。範例對比顯示,Sol 提供的回應比其 GPT‑5.6 前代更為穩重且精確。

代理的提示快取進步

OpenAI 引入更高的預設快取命中率,並對快取的輸入 token 讀取提供 90 % 折扣。新增的開發者工具包括:

  • 提示快取儀表板,用於視覺化快取使用情況。
  • 診斷工具,用於識別錯失的快取機會。
  • 控制 推理努力程度 和 工具可用性 的選項,同時保留快取的上下文。
  • 明確的斷點,用於定義快取提示的前置部分。 GitHub 報告指出,這些變更使 billions 筆請求中,新提示 token 處理的占比減少超過 50 %,大幅加快了 Copilot 的回應速度。

對齊進展

Sol 和 Luna 建立在 Astra 的對齊改進之上。內部評估顯示,與 GPT‑5.6 模型相比,其在程式設計任務中產生誤導性陳述的機率更低。所報告的指標針對刻意具有挑戰性的場景,並不代表一般使用情境下的失敗率。完整結果可於 GPT‑6 Astra 系統卡片中查閱。

可用性

  • ChatGPT Work 和 Codex:GPT‑6 Sol 和 GPT‑6 Luna 已對 Plus、Pro、Business、Enterprise 和 Edu 層級啟用。
  • 免費版和 Go 用戶:GPT‑6 Luna 可透過桌面應用程式存取。
  • API:模型可透過 gpt-6-sol 和 gpt-6-luna 訪問。
  • ChatGPT:將於當日逐步推出;若模型尚未顯示,使用者可能需要重試。

所有評估均在 OpenAI 的研究環境或透過 API 執行;生產環境的 ChatGPT 可能因系統提示和工具差異而有所不同。競爭對手的分數來自公開可取得的報告。

Sources