GPT-6 Astra 發佈說明 / 有什麼新功能

GPT-6 Astra 實現專業工作流程的直接電腦使用能力

GPT-6 Astra 旨在於現有的商業應用程式和工作流程中運行,無需自定義 API 或數據準備。透過利用電腦使用能力,Astra 可以像人類一樣與軟體進行互動,使其從第一天起就能在各種應用程式中執行任務。

專業應用場景包括:

  • Financial Modeling:在來自 Financial Modeling World Cup(基於 2023 Microsoft Excel World Championship)的挑戰中,GPT-6 Astra 完成任務的速度比獲勝的人類參賽者快約四倍。
  • Software Engineering:OpenAI 的內部工程團隊使用 Astra 解決了測試環境中的記憶體配置瓶頸,在峰值記憶體使用量增加約 30% 的情況下,實現了低 25 倍的轉向延遲(turn latency)。
  • Content Creation:該模型可以遵循公司特定的語氣、模板和設計標準,例如創建符合企業特定佈局和語氣的簡報投影片。

性能與成本效益基準測試

GPT-6 Astra 旨在使用更少的 token 和更少的重試次數來完成任務,從而降低每個任務的成本。OpenAI 表示,Astra 在專業工作和編碼評估中佔據了成本效益前沿(cost-efficiency frontier)的大部分。

Terminal Bench 4.0 結果

在 Terminal Bench 4.0(評估代理程式在包含系統配置和數據分析在內的複雜終端機任務上的表現)中,GPT-6 Astra 獲得了 57.9% 的分數。這優於之前的模型:

  • GPT-5.6 Sol:37.3%(Astra 在每個任務的預估 API 成本上低約 9%)。
  • Claude Fable 5.1:55.8%(Astra 在每個任務的預估 API 成本上低約 63%)。

定價

GPT-6 Astra 的 API 定價從每百萬個輸入 token 10 美元開始,每百萬個輸出 token 50 美元開始。

安全、對齊與企業控制

GPT-6 Astra 是 OpenAI 迄今為止對齊度最高的模型,具有更高的對人類意圖和授權的遵循度,以確保在商業系統中安全運行。

電腦使用安全基準測試

在測試數據刪除或機密資訊洩露等場景的內部電腦使用安全基準測試中,Astra 產生非預期結果的頻率比 GPT-5.6 Sol 低 89%,比 Claude Fable 5.1 低 74.7%。

企業管理控制

為了管理部署,OpenAI 推出了新的企業管理控制功能,允許組織:

  • 限制對核准的網站和桌面應用程式的訪問。
  • 管理上傳和下載。
  • 控制瀏覽歷史記錄。
  • 實施需要對重大影響行為進行核准的確認政策。
  • 對潛在不安全或未經授權的工具調用進行自動化審查。

網絡安全與準備度

GPT-6 Astra 是第一個在 OpenAI 的 Preparedness Framework 下達到「關鍵網絡安全能力閾值」的模型。作為回應,OpenAI 加強了對濫用和未經授權行為的保護,包括訓練模型尊重安全邊界,並部署自動化檢查以阻擋有害回應。

可用性與整合

GPT-6 Astra 可於 ChatGPT Work、Codex 和透過 API 使用。為了擴大訪問權限,OpenAI 正在於 ChatGPT Desktop 中推出針對 Oracle Analytics、Power BI (a Microsoft Fabric service)、Navan 和 Avalara 的新企業插件。

Sources