OpenAI 为网络关键能力调整模型开发节奏
OpenAI 已暂时放缓了模型规模扩展的速度,并暂停了特定的强化学习 (RL) 训练任务,以实施更严格的安全和对齐保障措施。这一决定是在 OpenAI-Hugging Face 安全事件发生后做出的,且初步证据表明即将推出的 Astra 模型可能达到了 OpenAI《准备就绪框架》(Preparedness Framework) 中定义的“关键网络安全能力”阈值。
加强研究环境安全
OpenAI 正在提高训练和评估环境的安全标准,以防止未经授权的访问,并防御具有先进网络安全能力的模型。在 OpenAI-Hugging Face 事件之后,实验室暂停了研究集群中任何能够执行代码或访问互联网的前沿模型推理任务。
为了建立深度防御,OpenAI 已实施以下控制措施:
- 工作负载隔离: 对于执行模型生成或不可信代码以及处理模型输出的软件,现在要求使用更强大的“沙箱”(sandboxes) 进行工作负载隔离。
- 网络隔离: 新的控制措施将高风险工作负载与互联网隔离,以确保单个服务的受损不会导致对内部网络或 Web 的未经授权访问。
- 持续安全测试: OpenAI 已移除易受攻击的共享服务,减少了常驻权限,并改进了安全日志监控。实验室还在利用其自身的模型,通过模拟攻击来自动执行对这些边界的持续测试。
这些最严格的保障措施目前对于所有与网络相关的任务以及涉及 Astra 模型的任务都是强制性的。许多 Astra 工作负载在迁移到这些增强型环境之前仍处于暂停状态。
多阶段思维链监控
OpenAI 扩展了其监控系统,以实时检测令人担忧的模型行为,特别是针对前沿 RL 训练和评估等高风险工作负载。
新的监控架构分阶段运行:
- 激活分类器 (Activation Classifiers): 这些检测器在每个采样的 token 时检查模型的内部活动。
- 自动化调查员 (Automated Investigators): 潜在的问题会被升级到高算力的调查员,这些调查员会分析工具操作、推理过程和活动序列,以寻找数据窃取、破坏性行为、未经授权的访问或试图绕过保障措施的迹象。
OpenAI 旨在在检测到令人担忧的活动后 30 分钟内发出警报。如果怀疑发生了关键安全边界违规,且在 30 分钟内无法证明是误报,则安全、安全与研究团队必须暂停该活动。这种监控对于所有“Sol capability”或更高能力的模型的 RL 训练和评估是强制性的,并且自 8 月 7 日起,所有涉及工具的 Astra 推理任务也必须进行此类监控。
推进对齐与风险缓解
为了应对奖励黑客行为 (reward hacking)、欺骗和未经授权的访问等风险,OpenAI 正在将其最强大的模型的训练过程中更多阶段集成核心对齐技术。
关键关注领域包括:
- 奖励模型改进: 增强奖励模型,以便在各种环境中更好地检测并遏制不安全行为。
- 诚实训练: 训练模型对其行为、能力和局限性更加透明。
- 减少利用行为 (Exploit Reduction): 减少利用工具、评分器、奖励或人类监督弱点的行为。
- 扩大覆盖范围: 增加模型在与外部资源交互时可能导致危害的行为的训练覆盖范围。
《准备就绪框架》的未来演进
OpenAI 打算演进其《准备就绪框架》,以将这些保障措施集成到训练和部署的两个阶段。实验室计划投资于模型辅助的安全技术,并与外部组织分享其发现。一份详细说明这些经验教训的技术报告预计将在未来几周内发布。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch