OpenAI GPT‑6 Sol 和 Luna 上市:價格砍半並性能概覽
TL;DR
OpenAI 發布了 GPT‑6 Sol 和 GPT‑6 Luna,每款價格均比前代 GPT‑5.6 降低 50 %,同時在專業任務表現、事實準確性、程式設計能力及電腦使用效率方面均有可測量的提升。
價格突破
| 模型 | 輸入價格(每 1 M tokens) | 輸出價格(每 1 M tokens) | 相對降幅 |
|---|---|---|---|
| GPT‑6 Sol | $2(從 $4 下調) | $10(從 $20 下調) | 50 % |
| GPT‑6 Luna | $0.10(從 $0.20 下調) | $0.50(從 $1.20 下調) | 50 % |
OpenAI 表示,這些降價已直接傳遞至 API 使用者與 ChatGPT 訂閱層級。更便宜的定價旨在讓先進 AI 成為日常自動化與大規模應用的實用選擇。
專業任務表現
- AutomationBench(47 工具工作流程基準):
- GPT‑6 Sol(極高努力)表現超越 Claude Opus 5(最大努力),但每項任務成本僅為 Opus 5 的 9 %。
- GPT‑6 Luna(高努力)相比前代提升 5.4 pp,成本降低 58 %。
- Agents’ Last Exam(複雜工作流程評估):GPT‑6 Sol(最大努力)得分 56.4 %,品質與 Claude Opus 5 相同,但成本低 60 %。
這些結果顯示 Sol 和 Luna 在企業流程自動化領域,於成本與智慧的邊界上佔據主導地位。
事實準確性提升
OpenAI 內部的事實準確性測試——基於使用者標記錯誤的真實對話——報告指出:
- GPT‑6 Sol 的事實錯誤數量約為 GPT‑5.6 Sol 的 一半,接近 Astra 等級的可靠性。
- GPT‑6 Luna 在高推理努力下運行時,事實準確性與 GPT‑5.6 Sol 相當,但成本僅為其 ≈1 %。
評估指出,測試集偏向易出錯的查詢,因此在一般使用情境下的絕對錯誤率更低。
程式設計基準
- FrontierCode(程式碼變更就緒度):GPT‑6 Sol 勝過 GPT‑5.6 Sol,並在遠低於價格的情況下與 Claude Fable 5.1(極高努力)表現相當。
- DeepSWE v1.1(軟體工程任務):GPT‑6 Sol(最大努力)得分 68.8 %,僅比 Claude Fable 5 最佳分數低 1.1 pp,但每項任務成本低 ≈80 %。
- GPT‑6 Luna(最大努力)得分 66.6 %,與 Claude Opus 5 相當,且每項任務便宜 93 %。
社群評論指出體驗不一:部分使用者認為 Luna 是「自由發揮」的配對程式設計師,而另一些人則報告 Luna 的程式設計分數相比 5.6 版本有所退步。
電腦使用效率
- OSWorld 2.0 offline(長遠期電腦使用工作流程):GPT‑6 Sol(極高)以 ≈80 % 的成本降低,達到 Claude Opus 5(中等)的表現。GPT‑6 Luna(最大)以 十分之一的成本,超越 GPT‑5.6 Sol(中等)。
對齊與溝通風格
OpenAI 表示 Sol 和 Luna 繼承了 Astra 的對齊改進,顯示出較低的誤導性程式設計主張率。定性範例突顯其語氣更簡潔、無技術術語,且奇異語句瑕疵更少。
提示快取增強
- 新增的 Prompt Caching Dashboard 與診斷工具,讓開發者可查看快取命中率與錯失機會。
- 調整 推理努力 或 工具可用性 現在可保留快取前綴,使快取輸入 token 讀取最多可享 90 % 折扣。
- GitHub 報告在數十億請求中,新快取工具帶來 >50 % 的全新 token 處理量減少,加速 Copilot 回應速度。
可用性
- ChatGPT Work 和 Codex:Sol 和 Luna 已對 Plus、Pro、Business、Enterprise 及 Edu 用戶上線。
- 免費/Go 用戶可透過桌面應用存取 Luna。
- API 識別碼:
gpt-6-sol和gpt-6-luna。 - ChatGPT 中逐步推出;模型可能於當天稍晚出現。
社群觀點(選摘 HN 評論)
- 價格影響 – 許多評論者(如 @simonw、@Cu3PO42)強調 Luna 的「驚人」$0.10/M‑輸入價格是遊戲規則改變者。
- 模型選擇 – 使用者討論何時應偏好 Sol、Luna 或 Astra;有人指出更高的推理層級可彌補較低基礎模型規模。
- 表現差異 – 多位使用者報告 Luna 的程式設計分數略低於 5.6 版,而 Sol 在極高努力下表現強勁,但因推理步驟增加而較慢。
- 快取工具 – 開發者如 @apitman 贊揚新快取儀表板,尤其在修復錯誤代理後。
- 競爭格局 – 評論者將 OpenAI 的價格戰與 Anthropic 的 Opus 5.5 進行比較,強調 OpenAI 透明的基準表格。
總結
OpenAI 的 GPT‑6 Sol 和 Luna 以 價格減半 的方式擴展 GPT‑6 家族,同時保留了 Astra 的大部分智慧。基準測試顯示其在自動化、事實準確性、程式設計與電腦使用任務上均具備更優的成本效益,而新快取工具進一步降低營運成本。此次發布使 OpenAI 在與 Anthropic 及其他前沿模型的競爭中處於有利地位,特別是針對高頻率開發者工作流程。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch