GPT‑5.6 Sol、Terra、Luna:效能、功能與可用性
GPT‑5.6 Sol、Terra、Luna:效能、功能與可用性
TL;DR
OpenAI 推出 GPT‑5.6 系列——以 Sol 為旗艦模型,Terra 為平衡模型,Luna 為最具成本效益的模型——提供更高的每 token 智能度,全新 ultra 設定可平行運行多個代理,並擁有迄今最完善的安全系統。
模型系列概覽
GPT‑5.6 包含三個層級:Sol、Terra 與 Luna。Sol 為高強度工作的旗艦模型,Terra 提供日常任務的平衡效能,Luna 則是最快且成本最低的選擇。三者皆屬同一代號,層級名稱則代表可獨立演進的持久能力等級。
效能與效率提升
GPT‑5.6 Sol 在程式編寫、知識工作、資安與科學等領域達到最先進的表現,同時使用更少的 token,且估計成本低於先前及競爭的前沿模型。在 Agents’ Last Exam 中,Sol 取得 53.6 分,較 Claude Fable 5 高出 13.1 分;在中等推理層級下,以約四分之一的估計成本超過 Fable 5 11.4 分。Terra 與 Luna 亦以約六分之一的成本超越 Fable 5。於 Artificial Analysis Intelligence Index 上,使用 max 推理的 Sol 與 Fable 5 差距僅一分,且完成任務的時間縮短 61%,成本約為一半。
程式編寫卓越表現
GPT‑5.6 Sol 在 Artificial Analysis Coding Agent Index 上創下 80 分的新最高紀錄,較 Claude Fable 5 高出 2.8 分,同時使用不到一半的輸出 token,耗時不到一半,成本約減少三分之一。Terra 的表現略高於 Fable 5,Luna 則超越 Claude Opus 4.8;它們皆在約三分之一的時間內完成,輸出 token 約減半,估計成本約為四分之一。Sol 亦在 Terminal‑Bench 2.1 與 DeepSWE 上創下最先進的成果,這兩項測試評估真實程式碼庫中的複雜指令列工作流程與長期工程。
知識工作與設計判斷
GPT‑5.6 Sol 在 BrowseComp 上取得 92.2% 的成績,在 OSWorld 2.0 上取得 62.6%,超越 Claude Opus 4.8,且使用的輸出 token 減少 85%。該模型能將自然語言請求轉化為 ChatGPT Work 中精緻的互動說明與視覺化。它能從 Slack、Notion、Microsoft 365 與 Google Drive 中提取雜亂的上下文,並轉換為專家級、可分享的成果物。在簡報、文件與試算表中,Sol 能產出更精緻且更準確的內容,能從零生成完整可編輯的簡報,並推斷投影片的設計系統——版面配置、字體、間距、色彩、重複內容模式——以忠實地將這些慣例套用於新素材。
資安能力與安全性
在 ExploitBench 上,GPT‑5.6 Sol 取得 73.5% 的成績,較 GPT‑5.5 的 47.9% 有顯著提升,且使用相當的輸出 token 預算。於 ExploitGym 中,其最高通過率幾乎翻倍,從 15.1% 提升至 24.9%(兩小時上限),六小時則達到 33.7%。在 SEC‑Bench Pro 上,得分為 71.2%,相較於 GPT‑5.5 的 45.8% 並改善了延遲。該模型支援防禦性任務,如安全程式碼審查、修補、威脅建模與藍隊作業,並透過 OpenAI Daybreak 的 Trusted Access 計畫取得驗證存取。GPT‑5.6 的安全防護是迄今最完善的,結合模型內部訓練的保護、即時檢查、持續監控與帳號層級的執行,並由推理監控器審查對話以防止潛在危害。與先前模型相比,Sol 的資安防護可阻擋約十倍的潛在有害活動,同時在較低能力模型上提供重新提示的選項,以減少良性使用的摩擦。
Ultra 與多代理工作流程
ultra 設定預設同時協調四個代理,透過較高的 token 使用換取更強的結果與更快的完成時間,適用於高需求任務。圖表顯示,加入平行代理會使 BrowseComp、SEC‑Bench Pro 與 Terminal‑Bench 2.1 的分數‑延遲前緣向上且向左移動,亦示範了 16 代理的配置。開發者可使用 Responses API 中的多代理測試版打造類似 ultra 的體驗。max 設定提供比 xhigh 更長的推理時間,讓模型能探索替代方案、執行檢查並修正其方法。
可用性、存取與定價
GPT‑5.6 Sol、Terra 與 Luna 從今天起即在 ChatGPT、Codex 與 OpenAI API 上提供,全球部署將在未來 24 小時內完成全面可用。於 ChatGPT 中,Plus、Pro、Business 與 Enterprise 用戶可透過中等及更高的努力設定存取 Sol;Pro 與 Enterprise 用戶亦可選擇 Sol Pro 以獲得最高品質的結果。Free 與 Go 用戶可在 ChatGPT Work 與 Codex 中使用 Terra;Plus、Pro、Business 與 Enterprise 用戶則可在 Sol、Terra、Luna 之間選擇,並為每個模型設定努力等級。max 切換在 ChatGPT Work 與 Codex 中對所有有存取權的使用者開放;ultra 則在 ChatGPT Work 中提供給 Pro 與 Enterprise 用戶,於 Codex 中則提供給 Plus 及更高方案。API 開發者可透過 OpenAI API 存取全部三個層級;Responses API 中的程式化工具呼叫允許模型編寫並執行協調工具的記憶體內程式,多代理測試版則支援同時子代理。每百萬 token 的定價為:Sol 輸入 $5 / 輸出 $30;Terra 輸入 $2.50 / 輸出 $15;Luna 輸入 $1 / 輸出 $6。提示快取更具可預測性,提供明確的快取斷點與 30 分鐘的最短快取生命;快取寫入按未快取輸入費率的 1.25 倍計費,快取讀取則享有 90% 的快取輸入折扣。
結論
GPT‑5.6 提供一系列模型,提升每美元的效能前緣,引入 ultra 規模的多代理推理,改善程式編寫、知識工作、設計判斷與資安防禦,並將這些進步與 OpenAI 迄今為止最完整的安全系統相結合。