OpenAI 推出 GPT-6 Sol 和 Luna
TL;DR
OpenAI 發布了 GPT‑6 Sol 和 GPT‑6 Luna,這兩款是 GPT‑6 Astra 的成本效益更高的繼任者,與 GPT‑5.6 相比,API 價格減半,同時在專業任務、事實準確性、程式設計和電腦使用工作負載方面保持高水準表現。
GPT‑6 系列擴充概覽
OpenAI 推出了 GPT‑6 Sol 和 GPT‑6 Luna,以補足旗艦型號 GPT‑6 Astra。這三款模型採用相同的訓練方法,但 Sol 和 Luna 經過優化,可降低延遲並減少推論成本。透過快取和推論基礎設施的改進,相較於 GPT‑5.6 的促銷定價,價格降低了 50 %,讓先進的人工智慧更易於應用於日常情境。
API 定價降低
| 模型 | 輸入價格(每 M tokens) | 輸出價格(每 M tokens) | 相對降幅 |
|---|---|---|---|
| GPT‑6 Sol | $4 → $2 | $20 → $10 | 50 % 更便宜 |
| GPT‑6 Luna | $0.20 → $0.10 | $1.20 → $0.50 | 50 % 更便宜 |
價格以每 1 百萬 tokens 計價。GPT‑6 Astra 仍為需要最佳結果的使用者的頂級模型。
專業工作表現
關鍵結果
GPT‑6 Sol 在 AutomationBench 基準測試中表現優於 Claude Opus 5,但每項任務成本僅為 Opus 5 的 9 %;GPT‑6 Luna 相較於前代模型提升 5.4 個百分點,且成本降低 58 %。
詳細比較
- AutomationBench 1.0.6 評估 AI 代理在 47 種工具上的端到端工作流程。GPT‑6 Sol(xhigh effort)得分 33.2 %,每任務成本為 $0.27,在得分與成本兩方面均超越 GPT‑6 Astra(low effort)和 Claude Opus 5(max effort)。
- 在 Agents’ Last Exam 上,GPT‑6 Sol(max effort)達成 56.4 %,超越 Claude Opus 5,同時每任務成本降低 60 %。
事實正確性提升
GPT‑6 Sol 在 OpenAI 內部的事實正確性基準測試中,錯誤數量約為 GPT‑5.6 Sol 的一半,接近 Astra 的可靠性,但成本僅為其一小部分。GPT‑6 Luna 同樣表現顯著進步,在高努力等級下,以約百分之一的成本達到與 GPT‑5.6 Sol 相同的事實正確性。
程式設計能力與成本效率
關鍵結果
在 FrontierCode 和 DeepSWE v1.1 基準測試中,GPT‑6 Sol 提供的程式設計品質與頂級競爭對手模型相當,同時每任務成本降低高達 80 %。
基準細節
- FrontierCode:GPT‑6 Sol 優於 GPT‑5.6 Sol,並以更低的成本達到與 Claude Fable 5.1(xhigh effort)相同的表現。
- DeepSWE v1.1:GPT‑6 Sol(max effort)得分 68.8 %,僅比 Claude Fable 5 最佳得分低 1.1 個百分點,但每任務成本約降低 80 %。GPT‑6 Luna(max effort)得分 66.6 %,與 Claude Opus 5 和 Claude Fable 5 在中等努力等級下的表現相當,但每任務成本降低 93 %–96 %。
電腦使用表現
GPT‑6 Sol(xhigh effort)在 OSWorld 2.0 離線測試中達成 60.5 % 的得分,與 Claude Opus 5(medium effort)相當,但成本降低約 80 %。GPT‑6 Luna(max effort)超越 GPT‑5.6 Sol(medium effort),且僅使用其十分之一的成本。
增強的協作風格
Sol 和 Luna 延續了 Astra 精緻的溝通風格:說明更清晰、減少術語使用、減少無關細節,並以稍短的回答保持內容完整性。範例對比顯示,Sol 提供的回應比其 GPT‑5.6 前代更為穩重且精確。
代理的提示快取進步
OpenAI 引入更高的預設快取命中率,並對快取的輸入 token 讀取提供 90 % 折扣。新增的開發者工具包括:
- 提示快取儀表板,用於視覺化快取使用情況。
- 診斷工具,用於識別錯失的快取機會。
- 控制 推理努力程度 和 工具可用性 的選項,同時保留快取的上下文。
- 明確的斷點,用於定義快取提示的前置部分。 GitHub 報告指出,這些變更使 billions 筆請求中,新提示 token 處理的占比減少超過 50 %,大幅加快了 Copilot 的回應速度。
對齊進展
Sol 和 Luna 建立在 Astra 的對齊改進之上。內部評估顯示,與 GPT‑5.6 模型相比,其在程式設計任務中產生誤導性陳述的機率更低。所報告的指標針對刻意具有挑戰性的場景,並不代表一般使用情境下的失敗率。完整結果可於 GPT‑6 Astra 系統卡片中查閱。
可用性
- ChatGPT Work 和 Codex:GPT‑6 Sol 和 GPT‑6 Luna 已對 Plus、Pro、Business、Enterprise 和 Edu 層級啟用。
- 免費版和 Go 用戶:GPT‑6 Luna 可透過桌面應用程式存取。
- API:模型可透過
gpt-6-sol和gpt-6-luna訪問。 - ChatGPT:將於當日逐步推出;若模型尚未顯示,使用者可能需要重試。
所有評估均在 OpenAI 的研究環境或透過 API 執行;生產環境的 ChatGPT 可能因系統提示和工具差異而有所不同。競爭對手的分數來自公開可取得的報告。
Sources
- OriginalIntroducing GPT-6 Sol and Luna