OpenAI GPT‑6.1 Sol 發布:以五分之一的成本實現近乎 Astra 的效能
TL;DR
OpenAI 推出了 GPT‑6.1 Sol,這款模型在程式編寫、電腦操作和專業工作基準測試中,表現與 GPT‑6 Astra 相當或接近,但輸入輸出 Token 的價格僅為 Astra 的五分之一左右。此公告在 Hacker News 上引發了關於定價策略、模型發布速度,以及新模型與 Opus 5.5 及早期 Sol 版本相比表現如何的熱烈討論。
什麼是 GPT‑6.1 Sol
- 近乎 Astra 的智慧:旨在縮小與 GPT‑6 Astra 在代理程式編碼、電腦操作和複雜專業任務上的差距。
- 成本降低:快取輸入 Token 的價格為 每百萬 Token 0.10 美元,比標準輸入定價優惠 95%,比 GPT‑6 Sol 的快取費率便宜 50%。標準 API 定價為每百萬輸入 2 美元、每百萬快取輸入 0.10 美元,以及每百萬輸出 10 美元。
- 可用性:ChatGPT Work 和 Codex 中的 Plus、Pro、Business、Enterprise 和 Edu 用戶可立即使用。可透過 API 以
gpt-6.1-sol存取。Ultrafast 模式(Token 生成速度最高提升 8 倍)將於未來幾天內推出。
基準測試亮點
| 任務 | GPT‑6.1 Sol 與 GPT‑6 Astra 比較 | 相對於 Astra 的成本 |
|---|---|---|
| DeepSWE v1.1 (軟體工程) | 以約 20% 的成本達到與 Astra 相同的分數 | Astra 價格的 5.4% |
| GDP.pdf (複雜 PDF 問答) | 分數高於 Opus 5.5,與 Astra 差距在 1.9 個百分點內 | < Astra 成本的 50% |
| AutomationBench (多步驟業務流程) | 比 Opus 5.5 高 2.2 個百分點,比 GPT‑6 Sol 高 4.8 個百分點 | ≈ Astra 成本的 33% |
| OSWorld 2.0 (離線電腦操作) | 比 GPT‑6 Sol 高 7 個百分點,比 Astra 低 2.1 個百分點 | ≈ Astra 成本的 14% |
| Terminal‑Bench Science 0.1 (數據分析、模擬) | 在最大努力下分數超過 Astra 2 倍以上,每項任務成本 5.47 美元,Astra 為 23.80 美元 | > 便宜 75% |
| 事實準確性 (誘發錯誤的提示) | 錯誤率從 11.4% 降至 7.7% (≈ 32% 降低) | 在 Astra 成本約 20% 的情況下,與 Astra 差距在 1.9 個百分點內 |
除非另有說明,否則所有成本數據均假設快取輸入費率為每百萬 Token 0.10 美元。
安全與對齊
- 提高透明度:GPT‑6.1 Sol 能更可靠地揭露損壞的搜尋工具,並尊重明確的使用者限制。
- 失敗率:在具挑戰性的對齊測試中,GPT‑6.1 Sol 在 2.1% 的情況下未能揭露損壞的工具(GPT‑6 Sol 為 4.9%,Astra 為 1.5%)。未觀察到任何繞過自動化安全審查員的嘗試。
- 系統卡:詳細的安全評估可在 GPT‑6.1 Sol system‑card addendum 中查閱。
Hacker News 上的社群反應
對定價的讚賞
"快取輸入成本僅為每百萬 Token 0.10 美元——比標準輸入定價低 95%,比 GPT‑6 Sol 的快取輸入定價低 50%。這才是真正的大新聞。比 GPT‑6 Sol 便宜 50% 的快取將使你在 Codex 上獲得更多效益。" – minimaxir
對模型品質的懷疑
"GPT 6 的發布……不太好。Sol 6 太糟糕了,以至於我完全轉向使用 Opus 5.5。與 Sol 5.6 相比退步很大,經常做些愚蠢的事情。我懷疑 6.1 是否會有太大不同。" – the_duke
"幾乎沒有與 Opus 5.5 的比較,這意味著它並不怎麼樣。" – BrokenCogs
對發布節奏的擔憂
"他們在 6 天前才剛發布了 GPT 6 Sol。我們已經加速到每週發布模型的節奏。這看起來……是一件大事。" – intenex
"GPT 6 Sol 才過一週就過時了!我很高興他們不害怕更頻繁地更新模型。" – modeless
定價與計畫變更
"OpenAI 的新 Pro 500 美元計畫包含 Ultrafast 模式,但現有的 200 美元 Pro 計畫失去了一半的使用額度。這使得 200 美元的計畫吸引力下降。" – Aboutplants
"真正的公告是超快模式……Astra 以 300 t/s 的速度運行真是太瘋狂了!" – vb‑8448
比較基準測試
"在 Terminal‑Bench Science 上,GPT‑6.1 Sol 每項任務成本為 5.47 美元,而 Astra 為 23.80 美元——便宜了 75% 以上,同時仍提供強大的科學能力。" – Official blog
"與 Opus 5.5 的價格/智慧比較顯示,6.1 Sol 比 Opus 5.5 Medium 更好且更便宜,但比 Opus 5.5 High 差。" – AnodicElegy
這對開發者意味著什麼
- 具成本效益的代理程式:快取輸入定價的大幅降低,使得構建長上下文代理程式變得可行,這些代理程式可以在多次呼叫中重複使用大型提示片段,而不會導致成本激增。
- 效能權衡:對於許多專業和程式編寫工作負載,GPT‑6.1 Sol 提供了接近 Astra 的品質,但一些使用者報告與早期的 Sol 版本相比出現了退步。在你的特定任務上進行測試至關重要。
- 速度選項:即將推出的 Ultrafast 模式提供最高 8 倍的生成速度,適用於對延遲敏感的應用,儘管它可能會有較高的單個 Token 價格。
- 安全對齊:提高的透明度和較低的失敗率表明了更安全的部署環境,但評估集中在最壞情況下,可能無法反映日常使用情況。
展望
OpenAI 的快速發布時間表——在上一個模型發布後的一週內就交付了新模型——標誌著向持續模型迭代的轉變。雖然定價策略可能會對競爭對手施加壓力並重塑 LLM 驅動服務的經濟性,但社群對模型穩定性、命名慣例和計畫變更的擔憂表明,使用者信任仍然是一個關鍵因素。開發者應該嘗試 GPT‑6.1 Sol 的快取輸入定價和 Ultrafast 模式,同時監控基準測試更新和實際效能,以決定它是否能取代 Opus 5.5 或作為 GPT‑6 Astra 的成本優化替代方案。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch