结合人员与 AI 推进红队工作 – OpenAI 的方法及其在 o1 系列上的应用
TL;DR
OpenAI 发布了一份白皮书,概述了其用于 AI 模型外部红队的四步方法,并描述了该方法在公开发布前如何被用于测试 OpenAI o1 系列。
外部红队方法
该白皮书描述了一种可重复的流程,用于设计有效的红队行动。
1. 选择红队小组的组成
红队小组的组成基于模型的目标和关键测试领域。团队包括具有不同视角的人员,例如自然科学、网络安全、地区政治知识或所使用语言方面的专家。威胁建模在演练之前进行,以根据预期的模型能力、先前观察到的问题以及潜在应用来优先考虑测试领域。内部团队设定初始优先级,外部红队成员随后会对其进行细化或扩展。
2. 决定红队成员可访问的模型或系统版本
提供给红队成员的模型版本可能会影响结果,并且应与活动目标保持一致。在没有安全缓解措施的早期访问测试中,可以发现能力提升带来的新风险;而后续版本则可以测试计划中的缓解措施。红队成员在整个活动过程中可能会测试多个版本。
3. 创建接口、说明和文档指导
有效的交互依赖于清晰的说明、合适的测试接口以及可操作的文档。说明涵盖模型描述、现有或计划中的防护措施、如何使用接口、优先测试领域以及记录结果的指南。接口可以是 API 或诸如 ChatGPT 之类的消费者产品接口,从而实现快速的程序化测试、对特定提示的反馈收集或用户交互的模拟。这些接口的结构化反馈随后可用于风险评估和自动化评估。
4. 综合数据并创建评估
活动结束后,红队的输出将经过质量评估,并映射到现有政策,以确定它们是否违反政策、需要新政策或需要行为改变。通过质量检查的数据可以转化为可重复的自动化评估,用于未来的模型更新。
在 OpenAI o1 系列上的应用
OpenAI 应用此方法为 OpenAI o1 系列模型的公开使用做准备。外部红队活动测试了模型的以下方面:
- 抵御越狱的能力
- 对真实世界攻击规划提示的安全处理
- 在自然科学中的安全应用
- 更广泛的主题,如 AI 研究和开发能力
该活动遵循了上述四个步骤,使用适当的团队组成、模型版本、接口和文档生成数据,这些数据随后进入政策审查和自动化评估管道。
注意:所有详细信息均直接来源于白皮书及其随附的公告;未添加任何外部声明、数字或引用。