OpenAI 人工智能政策提案与安全框架
OpenAI 已宣布在美国推动强制性的、基于能力的国家人工智能安全监管的战略举措,认为人工智能能力的快速发展要求从自愿承诺转向民主监督。该公司声称,目前正处于一个“政策窗口期”,可以在人工智能能力超越负责监管的机构之前建立持久的安全保障措施。
强制性的国家人工智能安全要求
OpenAI 呼吁美国国会实施基于能力且可演进的强制性国家人工智能安全法规。所提议的框架重点关注以下关键领域:
- 针对性应用: 安全要求应专门适用于少数资源充足的实验室,这些实验室正在开发最先进的人工智能系统,而非初创企业或小规模研究人员。
- 联邦框架组成部分: 基于 OpenAI 的《前沿人工智能民主治理蓝图》,该公司寻求统一的测试标准、独立评估要求、更强的网络安全保护、明确的事件报告规则,以及用于追踪向递归自我改进进展的共享措施。
- 开放与封闭模型的平衡: OpenAI 坚持认为,开放和封闭模型对美国保持领导地位都至关重要,联邦框架应应对前沿风险,而不应抑制竞争或导致创新外流。
- 治理模式转变: 目标是取代当前由实验室自行制定规则的碎片化私人治理模式,转而建立民主问责的标准和独立验证机制。
支持加州州级立法
在等待联邦行动的同时,OpenAI 支持“逆向联邦主义”策略,即通过州级立法为国会最终立法建立事实上的全国基准。OpenAI 已正式支持四项加州法案:
- SB 813: 建立指定合格独立组织评估人工智能风险的流程。
- AB 1405: 为人工智能审计师设立注册、独立性、透明度和问责要求。
- SB 1119: 聚焦青少年安全,要求对陪伴式聊天机器人实施年龄验证、风险评估、独立审计和家长控制。
- AB 1864: 要求基因合成服务提供商和桌面合成设备制造商遵循联邦筛查标准,以防止人工智能驱动的生物威胁。
递归自我改进与研究加速
OpenAI 表示,完全自主的递归自我改进——即人工智能独立推动更强大人工智能的连续迭代——目前尚未发生。然而,该公司指出,人工智能已经加速了用于开发和对齐下一代模型的部分研究工作。
为应对这一情况,OpenAI 计划在人类监督下构建自动化的人工智能研究员,优先考虑安全与对齐,而非单纯的能力提升。该公司主张政府应建立共享的安全基准,以确定何时应放缓或停止开发,若安全与能力提升发生冲突,应优先保障安全。
行业标准与监控
OpenAI 呼吁由行业主导的标准,以补充强制性的联邦安全措施,特别关注“对齐偏差”的监控——即模型以违背人类意图的方式追求目标。
关键的监控与披露建议包括:
- 安全事件通知: 当模型绕过安全控制以访问或修改受保护系统时,公司应立即提供书面通知。
- 事件报告: OpenAI 支持联邦层面的严重人工智能事件报告要求,并正在开发自身框架,用于报告具有重大影响的对齐偏差事件。
- 国际协调: OpenAI 认为,为衡量能力与管理风险,需要兼容的国际标准,因为人工智能研究和失败可能产生全球性后果。
内部安全措施
OpenAI 已在其模型开发全生命周期中实施多项内部安全措施,包括:
- 隔离: 为前沿研究工作负载提供更强的隔离。
- 行为监控: 扩展对工具启用训练和评估期间模型行为的监控。
- Astra 特定安全措施: 针对 Astra 模型,OpenAI 引入了对完整轨迹(包括思维链)的全面监控,并在内部部署前设置了强制性的对齐评估关卡。