OpenAI Astra:应对关键网络能力

OpenAI 宣布,对其即将推出的 Astra 模型的内部评估表明,其在智能编程(agentic coding)和网络安全方面取得了重大进展。这些结果使 OpenAI 得出结论,不能排除 Astra 已达到其“准备框架”(Preparedness Framework)所定义的“关键”(Critical)网络能力阈值。

关键网络安全阈值定义

当模型能够在无需人类干预的情况下执行以下操作时,即被归类为达到“关键”网络安全阈值:

  • 在许多经过加固的现实世界关键系统中,识别并开发所有严重程度级别的功能性零日漏洞(zero-day exploits)。
  • 仅基于高层目标,为针对加固目标的网络攻击设计并执行端到端的创新策略。

虽然评估仍在进行中,但 Astra 的初步结果显示其性能足够强大,以至于不能排除达到这一“关键”级别的可能性。OpenAI 明确表示,Astra 未参与对 Hugging Face 的漏洞利用。

安全控制与缓解措施

为了管理与这些能力相关的风险,OpenAI 正在扩大对防护措施和安全控制的鲁棒性测试。该公司正在为高能力模型实施多项内部安全措施:

  • 基础设施保护: 实施隔离的测试环境、受限的网络和工具访问、增强的模型权重加密与保护,以及沙箱化执行。
  • 活动暂停: 目前已暂停涉及 Astra 且不符合这些强化安全要求的内部活动。
  • 通用监控: 对 Astra 的所有智能应用(包括训练和评估)中的风险行为和失调行为实施监控。这些监控器通过分析模型的 Chain of Thought 来触发安全响应并中断高风险活动。
  • 外部协作: OpenAI 将与政府机构和选定的 AI 安全组织合作,测试该模型的能力。
  • 第三方指导: 公司将向第三方测试合作伙伴提供建议的安全控制措施,以确保高风险评估和工作负载的安全运行。

背景与准备框架

OpenAI 于 2023 年 12 月发布的“准备框架”旨在指导识别生物、化学、网络安全和 AI 自我改进等领域的能力进展。之前的模型(包括 GPT-5.6-Sol)在评估前沿网络能力时,被评定为“高”(而非“关键”)阈值。

此响应遵循与 2025 年 6 月关于接近生物领域高能力阈值模型的公告类似的协议,当时 OpenAI 加强了防护措施并扩大了测试,以便负责任地部署能力。

Sources

相关