OpenAI 与美国 CAISI 和英国 AISI 的安全合作
OpenAI 已与美国人工智能标准与创新中心(CAISI)和英国人工智能安全研究所(UK AISI)建立了自愿合作伙伴关系,以提升前沿 AI 系统的安全性。这些合作侧重于联合红队测试、端到端产品测试,以及创建快速反馈循环,以解决代理式 AI 和生物安全防护措施中的漏洞。
与美国 CAISI 合作保障代理式 AI 系统安全
OpenAI 与 CAISI 合作评估代理式 AI 系统的安全性,特别是针对 ChatGPT Agent 产品。此次合作由跨学科的网络安全和 AI 代理安全专家团队组成,团队获得了系统架构的提前访问权限,以识别漏洞。
发现复杂的利用链
CAISI 在 ChatGPT Agent 中发现了两项新型安全漏洞。虽然最初看似不可利用,CAISI 发现将这些传统软件漏洞与 AI 代理劫持攻击相结合,可绕过基于 AI 的安全防护。这导致了一个完整的利用链,成功率约为 50%。
如果攻击成功,复杂的攻击者可能能够:
- 在会话期间远程控制代理访问的计算机系统。
- 冒充用户在其已登录的其他网站上进行操作。
OpenAI 报告称,这些漏洞在报告后一个工作日内已得到修复。
与英国 AISI 合作加强生物安全防护措施
2021 年 5 月,英国人工智能安全研究所(UK AISI)开始对 OpenAI 的生物滥用防护措施进行红队测试,覆盖 GPT-5 和 ChatGPT Agent。这是一项持续的合作,旨在不断改进防护体系,而非仅针对单次发布。
深度系统访问以进行严格测试
为便于全面评估,UK AISI 获得了对非公开资源的高级访问权限,包括:
- 防护系统的非公开原型。
- 仅提供帮助的模型变体,已移除安全护栏。
- 关于生物滥用的内部政策指南。
- 访问内部安全监控模型的思考链(CoT)。
- 在测试期间能够选择性地禁用缓解措施和强制执行。
结果与迭代改进
UK AISI 识别了十余份详细的漏洞报告。这些发现促成了多种改进:
- 工程修复: 基于漏洞报告的直接产品修复。
- 政策执行: 对政策执行的实现修复。
- 政策训练: 有针对性的训练以提升分类器。
- 监控鲁棒性: 改进监控堆栈,以防御 UK AISI 识别的通用 jailbreak。
- 配置修复: 解决配置漏洞,防止恶意内容在未触发审核的情况下被提取或输入。
UK AISI 认为完整的审核系统防护已得到显著加强。到迭代期结束时,构建通用攻击需要复杂的技术和大量的审核标记,这意味着恶意行为者很可能会被标记并封禁。
公私安全合作的战略意义
这些合作展示了政府国家安全专长与私营 AI 开发深度融合的模式。OpenAI 指出,这些合作伙伴关系提供了若干关键收益:
- 国家安全专长: 获得政府在机器学习和计量学方面的专业知识,能够识别其他方可能遗漏的问题。
- 技术基础: 实践经验使政府能够制定技术扎实的最佳实践,推动全行业安全加速。
- 问责与信任: 外部专家分析提升了已部署系统的信任度和问责性。
- 持续评估: 持续的合作比一次性部署前评估提供更大的价值。