OpenAI 网络韧性战略
OpenAI 已宣布一项全面战略,以管理推进 AI 网络安全能力的双重使用风险。公司正在部署分层安全栈,并建立新的防御工具和咨询机构,以确保随着模型变得更强大,它们将为网络安全防御者相较于恶意行为者提供显著优势。
AI 网络能力的快速进步
AI 模型正在展示其执行网络安全任务能力的显著提升。OpenAI 报告称,通过夺旗(CTF)挑战测量的能力从 2025 年 8 月的 GPT-5 的 27% 提升至 2025 年 11 月的 GPT-5.1-Codex-Max 的 76%。
OpenAI 正在为达到其准备框架所定义的“High”级别网络安全能力的模型做准备。该级别被定义为能够针对防护严密的系统开发可工作的零日远程漏洞,或为复杂、隐蔽的企业或工业入侵操作提供有意义帮助的模型。
用于减轻滥用的分层安全栈
由于防御和进攻的网络工作流程往往依赖于相同的底层知识,OpenAI 正在采用纵深防御方法,以限制恶意提升,同时保持对防御者的实用价值。
基础设施和监控
在基础层,OpenAI 采用以下组合:
- 访问控制
- 基础设施加固
- 出口控制
- 系统范围监控以检测潜在的恶意活动
当检测到不安全活动时,系统可能会阻止输出、将提示路由到能力较弱的模型,或根据严重程度和重复行为将问题升级以供人工审查。
模型训练和红队演练
OpenAI 正在训练前沿模型,以拒绝使能明显网络滥用的请求,同时在教育和防御用例中保持有帮助。为了验证这些防护措施,公司与专业红队组织合作,进行端到端评估,模拟决心坚定且资源充足的对手,以识别并弥补安全漏洞。
用于防御韧性的生态系统倡议
OpenAI 正在启动若干倡议,旨在加速负责任的修复并为防御者提供先进工具。
Aardvark 代理安全研究员
Aardvark 是一款目前处于私人测试阶段的代理安全研究员。它旨在通过扫描代码库并提出补丁,帮助开发者和安全团队大规模发现并修复漏洞。Aardvark 已在开源软件中识别出新颖的 CVE。OpenAI 计划为精选的非商业开源仓库提供免费覆盖,以保障软件供应链安全。
可信访问和咨询委员会
OpenAI 正在推出可信访问计划,以向符合条件的网络防御用户提供在最新模型中增强能力的分层访问。此外,公司正在建立前沿风险委员会,这是一个由经验丰富的网络防御者和安全从业者组成的咨询组织,将就负责任能力与潜在滥用之间的边界提供建议。
全行业合作
为了应对所有前沿模型中的网络滥用风险,OpenAI 通过前沿模型论坛与其他实验室合作。这一非营利性工作旨在发展对威胁模型的共同理解,识别武器化路径,并识别威胁行为者的关键瓶颈。OpenAI 还在与外部团队合作,开发独立的网络安全评估,以在整个行业内建立对模型能力的共同理解。