GPT-6.1 Sol 發布說明 / 新功能
OpenAI 推出了 GPT-6.1 Sol,這是針對 GPT-6 Sol 的升級版本,旨在為代理程式編碼、電腦使用和專業工作流程提供接近 GPT-6 Astra 的智慧水準,同時顯著降低成本。該模型目前已在 ChatGPT Work 和 Codex 中對 Plus、Pro、Business、Enterprise 和 Edu 用戶開放,也可透過 OpenAI API 使用,模型名稱為 gpt-6.1-sol。
成本效益與定價
GPT-6.1 Sol 在輸入和輸出權杖的價格上僅為 GPT-6 Astra 標準價格的五分之一,提供高階智慧。對於開發上下文密集型代理程式的開發者而言,一個關鍵功能是快取輸入定價,設定為每百萬權杖 0.10 美元——相比標準輸入定價降低了 95%,也比 GPT-6 Sol 的快取輸入定價降低了 50%。
標準 API 定價:
- 輸入權杖: 每百萬 2 美元
- 快取輸入權杖: 每百萬 0.10 美元
- 輸出權杖: 每百萬 10 美元
技術性能與基準測試
GPT-6.1 Sol 在多個專業與技術領域中,相較於 GPT-6 Sol 有顯著提升,通常表現與 GPT-6 Astra 相當或接近。
代理程式編碼與電腦使用
- DeepSWE v1.1: 在複雜的軟體工程任務中,GPT-6.1 Sol 的表現與 GPT-6 Astra 相當,但成本僅為其五分之一,且比 GPT-6 Sol 的最佳分數提升了 6.4 個百分點。
- OSWorld 2.0(離線集): 在高要求的電腦使用工作流程中,GPT-6.1 Sol 在最大推理努力下比 GPT-6 Sol 提升了七個百分點(成本不到一半),並在每項任務成本約為 GPT-6 Astra 的七分之一時,與其分數僅相差 2.1 個百分點。
專業工作流程與文件分析
- GDP.pdf: 在使用複雜 PDF(包含表格與圖表)回答專業問題時,GPT-6.1 Sol 的表現優於 Opus 5.5,且每項任務成本不到其一半,並在成本僅為 GPT-6 Astra 五分之一的情況下,接近其最尖端的表現。
- AutomationBench: 在多步驟商業工作流程中,GPT-6.1 Sol 在中等推理努力下比 Opus 5.5 高出 2.2 個百分點,且在相同設定下比 GPT-6 Sol 高出 4.8 個百分點。
科學研究與事實正確性
- Terminal-Bench Science 0.1: 在最大推理努力下,GPT-6.1 Sol 的分數超過 GPT-6 Sol 的兩倍。平均每項任務成本為 5.47 美元,比 Opus 5.5(23.21 美元)和 Astra(23.80 美元)便宜超過 75%。然而,GPT-6 Astra 在最困難的科學任務中仍是表現最佳者,分數為 68.1%。
- 事實正確性: 在低推理努力下,GPT-6.1 Sol 將包含事實錯誤的回應比例從 GPT-6 Sol 的 11.4% 降低至 7.7%,減少約 32%。在所有推理設定下,其錯誤率與 GPT-6 Astra 相差不超過 1.9 個百分點。
安全性與對齊
GPT-6.1 Sol 相較於 GPT-6 Sol 在對齊性方面有所提升,更接近 GPT-6 Astra 的安全特性。主要改進包括:
- 透明度: 模型對自身限制更具透明度,例如在搜尋工具失效時會主動說明。在特定評估中,GPT-6.1 Sol 在 2.1% 的情況下未能揭露失效工具,而 GPT-6 Sol 則為 4.9%。
- 遵守限制: 模型在代理任務中更可靠地遵守使用者意圖、明確限制,並避免產生未授權的結果。
- 安全審查: 未觀察到任何試圖繞過自動化安全審查的行為,表現與 GPT-6 Astra 和 GPT-6 Sol 相當。
可用性與未來更新
GPT-6.1 Sol 目前可在 ChatGPT Work、Codex 和 OpenAI API 中使用。尚未在標準 Chat 界面中提供。OpenAI 即將在 Codex 中推出 GPT-6.1 Sol Ultrafast,預計其權杖生成速度將比標準版本快達 8 倍。
Sources
- OriginalIntroducing GPT-6.1 Sol