OpenAI 网络安全资助计划:支持 AI 驱动的防御研究

OpenAI 已启动网络安全资助计划,以支持赋能网络防御者的研究和工具。该计划侧重于利用 AI 缓解安全威胁、保护大型语言模型(LLM),以及自动化软件漏洞的检测和修复。

LLM 可信度与模型安全

对模型本身安全性的研究是资助计划的主要重点。关键项目包括:

  • Prompt-Injection 防御: 加州大学伯克利分校的 Wagner 实验室,由 David Wagner 教授领导,正在开发防御提示注入攻击的技术,以提升 LLM 的整体可信度。
  • 训练数据隐私: 达特茅斯学院的 Breuer 实验室,由 Adam Breuer 教授领导,正在研究防御技术,以防止对手通过模型交互重建私有训练数据,目标是在不牺牲模型准确性或训练效率的前提下实现。
  • 安全推理基础设施: Mithril Security 已创建概念验证和开源工具,使用基于可信平台模块(TPM)的安全 enclave 在 GPU 上部署 AI 模型。该架构旨在确保发送给 AI 提供商的数据保持机密,即使是管理员也无法访问。

自动化漏洞检测与修复

AI 正在用于识别并仅修复软件和代码中的安全缺陷:

  • 软件配置错误: Coguard 正在使用 AI 自动检测软件配置错误——这是一种常见的安全事件原因——用 AI 驱动的自动化取代过时的基于规则的策略。
  • 代码漏洞分析: 波士顿大学安全实验室(SeclaBU)和 Peac 实验室的研究人员,包括博士生 Saad Ullah 以及 Gianluca Stringhini 教授和 Ayse Coskun 教授,正致力于提升 LLM 检测和修复代码漏洞的能力,以在恶意利用之前防止漏洞被利用。

自主防御与红队演练

该计划支持在主动防御场景中探索基础模型的应用:

  • 自主网络防御代理: 圣克鲁斯大学(UCSC)的 CY-PHY 安全实验室,由 Alvaro Cardenas 教授领导,正在设计能够自主响应网络入侵者的代理。该研究将基础模型与强化学习(RL)模型进行比较,以确定它们如何最佳协作,提升威胁分流和网络安全。
  • 自动化红队演练: 麻省理工学院计算机科学人工智能实验室(MIT CSAIL)的研究人员正在使用提示工程在计划-执行-报告循环中自动化红队演练期间的决策过程和可操作响应。他们还在夺旗赛(CTF)挑战中测试 LLM‑Agent 的能力,以在受控环境中发现漏洞。

Sources