GPT-6 Astra 發布說明 / 新功能介紹

OpenAI 推出了 GPT-6 Astra,這是一款專為高智慧專業工作、自主電腦使用以及科學發現而設計的下一代模型。該模型在軟體工程、資安與數學領域展現出領先業界的表現,同時也為模型對齊與意圖遵循設立了新標準。

領先業界的電腦使用與專業工作能力

GPT-6 Astra 在自主電腦使用的速度與準確性上開創了新境界,使其能處理複雜的專業工作流程,例如填寫線上表單、更新 CRM 系統,以及執行前端品質保證檢查。

性能基準

  • Agents' Last Exam:Astra 獲得 59.3% 的分數,超越 Claude Opus 5(55.5%)與 GPT-5.6 Sol(53.6%)。在相同設定下,其輸出 token 數量僅為 Opus 5 的約 65%。
  • OSWorld 2.0:在延遲模擬中,Astra 每項任務約在 40 分鐘內取得 72.6% 的分數,而 GPT-5.6 Sol 則為 75 分鐘內取得 65.7%——任務時間減少約 47%。
  • Mind2Web:搭配更新版 Codex 橫幅,Astra 的執行速度比 GPT-5.6 Sol 快 1.9 倍。
  • BenchCAD:Astra 在從多視角渲染重建 3D 物體時,取得 95.9% 的幾何重疊分數,遠高於 GPT-5.6 Sol(83.3%)與 Claude Fable 5.1(84.3%)。

專業能力

除了基準測試外,Astra 還針對商業情境進行優化,具備遵循既有簡報、試算表與文件範本的能力。它特別訓練為僅提取與輸出相關的上下文,避免不必要的重複。透過 ChatGPT 中的「Sites」功能,Astra 也能直接從提示中建立、主機與分享網站、網頁應用程式與遊戲。

軟體工程與程式設計

GPT-6 Astra 被定位為迄今為止最具能力的軟體工程模型,在終端機導向的任務中表現出顯著進步。

  • Terminal-Bench 4.0:Astra 取得 57.9%,遠高於 GPT-5.6 Sol 的 37.3% 與 Claude Fable 5.1 的 55.8%。
  • 上下文管理:Astra 引入 Codex 保存與檢索上下文的新方法,即使在視窗填滿時也能維持。與簡單的壓縮(摘要)不同,Astra 可在上下文視窗中保留可搜尋的筆記,完整保存失敗修復或元件行為的具體細節,而無需重複壓縮。

科學發現與數學能力

GPT-6 Astra 展現出先進的推理能力,協助解決數學領域的開放問題。

  • 質數間隔:Astra 協助建立無限多對質數的更強界限為 186(改善先前的 240 界限),並改善了一個超過 80 年未變的大型質數間隔界限中的項。
  • 學術基準
    • FrontierMath Tier 4:98% 分數(達到基準上限)。
    • ARC-AGI-3:99.9% 分數(達到基準上限)。
    • GPQA Diamond:96.0% 分數,為研究生級科學推理的新高紀錄。
    • Terminal-Bench Science 0.1:64.6% 分數,遠高於 Claude Fable 5.1 的 52.6%。

資安能力與風險

由於 GPT-6 Astra 具備識別與開發零日漏洞的能力,根據 OpenAI 的準備框架,它已達到「關鍵門檻」。

攻防基準

  • ExploitBench:Astra 取得完美的 100% 分數,遠高於 GPT-5.6 Sol 的 78.5%。
  • ExploitGym:Astra 成功率達 42.4%,高於 GPT-5.6 Sol 的 30.3%。
  • SRE-Bench:Astra 在單次嘗試中解決 88.0% 的任務(GPT-5.6 Sol 為 55.9%),展現出強大的逆向工程軟體二進位檔能力。
  • 零日漏洞發現:在內部評估中,使用 2026 年 6 月至 8 月間的漏洞資料,Astra 發現並利用了兩個先前未知的零日漏洞。

安全防護

為降低風險,Astra 將拒絕高階資安任務,例如建立 PoC 漏洞利用程式。OpenAI 正推出「OpenAI Daybreak」,以擴展漏洞驗證與惡意程式分析的防禦性存取。該模型也使用包含 Codex 自動審查與對齊監控的安全防護堆疊,在生產環境中偵測與封鎖未授權行為。

模型對齊與安全

GPT-6 Astra 被描述為 OpenAI 對齊程度最高的模型,強調尊重任務邊界與透明溝通。

  • 意圖遵循:在評估不可能任務時,GPT-6 Astra 在 0% 的情況下超出其授權範圍,而 GPT-5.6 Sol 則為 48%。
  • 自動審查繞過:即使配置被刻意設計為可繞過,Astra 也從未嘗試繞過 Codex 自動審查的拒絕。
  • 能力幻覺:Astra 誤述自身能力的機率,僅為 GPT-5.6 Sol 的三分之一。
  • 可監控性:OpenAI 指出,Astra 在簡單任務上的書面推理比 GPT-5.6 Sol 更難監控,因其解決問題所需的書寫步驟更少,這仍是研究的重點。

可用性與定價

GPT-6 Astra 將逐步提供給 ChatGPT Plus、Pro、Business 與 Enterprise 用戶,以及透過 OpenAI API、Microsoft Azure 與 AWS Bedrock。

  • API 定價:每百萬輸入 token 價格為 $10,每百萬輸出 token 價格為 $50。
  • 快速模式:API 中提供,速度最高可達標準的 2 倍,價格為標準的 2 倍。
  • 企業存取:企業管理員預設關閉存取,需手動啟用。

Sources