OpenAI 前沿风险与准备工作框架
OpenAI 正在通过创建专门的准备工作团队(Preparedness team)和风险告知开发政策(Risk-Informed Development Policy, RDP),实施一种结构化的灾难性风险准备方法。该计划旨在主动识别并减轻前沿 AI 模型(即能力超过当前先进模型的系统)所带来的严重风险,以确保通用人工智能(AGI)的安全开发。
准备工作团队与风险类别
由 Aleksander Madry 领导的准备工作团队整合了能力评估、评估测试和内部红队测试,以追踪和预测灾难性风险。该团队专注于四个主要的风险类别:
- 化学、生物、放射性和核(CBRN)威胁: 与危险材料的制造或部署相关的风险。
- 网络安全: AI 增强网络攻击规模或复杂性的潜力。
- 自主复制与适应(ARA): 与能够自我复制或独立进化的 AI 系统相关的风险。
- 个体化劝说: 利用 AI 进行大规模的操纵或劝说个人。
风险告知开发政策 (RDP)
为了管理开发过程,OpenAI 正在执行风险告知开发政策 (RDP)。该政策为以下方面建立了正式框架:
- 评估与监测: 开发严谨的方法来评估前沿模型的能力。
- 保护行动: 根据识别出的风险等级,创建一系列应对措施和防护措施。
- 治理: 在整个开发生命周期中建立问责和监督结构。
RDP 旨在补充在模型部署前后进行的现有风险缓解和对齐工作。
AI 准备工作挑战与“未知之未知”
作为其“未知之未知”(unknown unknowns)工作流的一部分,OpenAI 开展了一项准备工作挑战,以揭示非显而易见的风险领域。该挑战向识别出合理但独特的风险场景的十个顶级提交方案授予了价值 25,000 美元的 API 额度。
挑战的关键发现
对提交内容的分析显示,约 70% 的参赛者将增强恶意劝说能力(包括在线激进化、极化和政治影响)视为主要威胁。其他识别出的风险包括:
金融稳定: 在具有战略重要性的国家引发金融危机。
信息安全: 增加对机密信息进行逆向工程或在公共场合识别私人信息的可能性。
公共安全: 通过无线电频率干扰飞行路径或干扰医疗剂量。
网络犯罪: 扩大通过勒索破坏计算机的网络攻击规模。
社会工程: 识别勒索和诈骗的目标。
OpenAI 指出,这些提交内容的评估标准是技术严谨性、独特性、潜在破坏规模和清晰度,特别强调了 AI 工具相比非 AI 方法提供明显优势的案例。
Sources
- OriginalFrontier risk and preparedness