OpenAI Astra: Addressing Critical Cyber Capabilities

OpenAI 已宣布,其即將推出的 Astra 模型在內部評估中顯示出在代理編碼(agentic coding)和網絡安全方面的重大進展。這些結果導致 OpenAI 得出結論,無法排除 Astra 已達到其「準備就緒框架」(Preparedness Framework)所定義的「關鍵」(Critical)網絡能力閾值。

Critical Cybersecurity Threshold Definition

當一個模型能夠在無需人工干預的情況下執行以下操作時,即被歸類為達到「關鍵」網絡安全閾值:

  • 在許多加固的真實世界關鍵系統中,識別並開發所有嚴重程度等級的功能性零日漏洞利用程序(zero-day exploits)。
  • 僅根據高層級目標,設計並執行針對加固目標的端到端新型網絡攻擊策略。

雖然評估仍在進行中,但 Astra 的初步結果顯示其性能強大到無法排除達到此「關鍵」等級的可能性。OpenAI 明確表示,Astra 並未參與 Hugging Face 的漏洞利用。

Security Controls and Mitigation Steps

為了管理與這些能力相關的風險,OpenAI 正在擴大對防護措施和安全控制的穩健性測試。該公司正在為高能力模型實施幾項內部安全措施:

  • Infrastructure Protections: Implementation of isolated testing environments, restricted network and tool access, enhanced encryption and protection of model weights, and sandboxed execution.
  • Activity Pauses: 內部涉及 Astra 的活動,若不符合這些強化的安全要求,目前已暫停。
  • Universal Monitoring: 實施對 Astra 所有代理應用程序(包括訓練和評估)中的風險行為和失調(misalignment)進行監控。這些監控器會分析模型的 Chain of Thought 以觸發安全響應並中斷高風險活動。
  • External Collaboration: OpenAI 將與政府機構和精選的 AI 安全組織合作,以測試模型的能力。
  • Third-Party Guidance: 該公司將向第三方測試夥伴提供建議的安全控制措施,以確保高風險評估和工作負載可以安全地運行。

Context and Preparedness Framework

OpenAI 於 2023 年 12 月發布的「準備就緒框架」(Preparedness Framework)作為識別生物學、化學、網絡安全和 AI 自我改進等領域能力進展的指南。之前的模型,包括 GPT-5.6-Sol,在邊界網絡能力方面被評估和評定為「高」(High)閾值(而非「關鍵」Critical)。

此回應遵循與 2025 年 6 月關於模型接近生物學高能力閾值的公告類似的協議,當時 OpenAI 強化了防護措施並擴大了測試,以便負責任地部署能力。

Sources

相關

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch