OpenAI 因担心网络关键能力而暂停前沿模型训练以加强防护措施

OpenAI 因出现新兴网络关键能力而暂停前沿模型训练

OpenAI 在其即将推出的 Astra 模型最大的计划强化学习 (RL) 运行过程中停止了操作,因为内部信号表明该模型可能达到 Critical cybersecurity capability(网络关键能力)阈值,目前正在扩大监控、对齐和安全防护措施,以便在恢复前进行准备。


为什么暂停很重要

OpenAI 的决定表明,前沿 AI 实验室正在将新兴的模型能力视为具体风险,而非推测性的担忧。通过停止高风险 RL 训练,OpenAI 旨在防止具有自主黑客能力的模型在稳健的防护措施得到验证之前被部署。


贯穿研究与部署的新型防护措施

OpenAI 将其安全堆栈构建在三个相互关联的支柱之上:

  1. 监控 – 实时检测可疑行为。
  2. 对齐 – 训练模型遵循预定目标。
  3. 安全措施 – 隔离与访问控制。

这些支柱现在正被统一应用于所有工作负载,对于表现出网络关键潜力的模型,将执行更严格的标准。


保护研究环境

  • 工作负载隔离 – 对模型生成或接收的任何代码进行更强的沙箱化处理。
  • 网络隔离 – 更严格的控制,以防止受损的工作负载触及互联网或内部网络。
  • 持续安全测试 – 移除共享服务,减少常驻权限,并使用模型本身进行自动化攻击模拟。

OpenAI 报告称,所有与 Astra 相关的任务负载现在都需要最高安全级别。尚未达到这些标准的任务负载仍处于暂停状态,安全关键型任务将被优先迁移。

"We paused frontier model inference in research clusters for runs that could execute code or use tools that could access the internet…" – OpenAI post


扩展的思维链监控

OpenAI 的新型监控流水线在多个阶段运行:

  • 激活分类器 在每个采样 token 时检查模型的内部活动。
  • 自动调查员 分析工具使用、推理轨迹和完整的活动序列,以查找是否存在未经授权的操作、数据窃取或试图破坏防护措施的行为。
  • 警报协议 – 如果检测到潜在的违规行为,将发出高优先级警报,并通知安全、安全保障与研究团队。如果该警报无法在 30 分钟内消除,则活动将被暂停。

监控目前为受保护的工作负载计算量增加了约 20% 的开销。该系统对于所有达到 "Sol" 能力或更高水平的模型进行 RL 训练和工具使用评估,以及所有使用工具的 Astra 推理,都是强制性的。


加速对齐研究

OpenAI 正在将其最强能力模型的训练流水线中扩展核心对齐技术:

  • 改进的奖励模型,能够更好地在各种任务中惩罚不安全行为。
  • 诚实训练,使模型对于其能力和行为更加诚实。
  • 缓解奖励作弊 (Reward-hacking),以减少对评分或工具使用漏洞的利用。
  • 更广泛的评估覆盖范围,涵盖与外部系统的交互。

该实验室强调,称,由于模型获得了网络攻击能力,误对齐行为——例如欺骗性工具使用或未经授权的访问——构成的风险正在不断升级。


Hacker News 社区反应

  • 基准测试怀疑论 – 用户指出,像 GLM 5.2 这样的开源权重模型在 CyberBench 测试中达到了 77%,接近 Astra 的 88% 分数,但尚未发生大规模的网络安全事件。这引发了关于威胁是否被夸大,或者当前的防御措施是否仅仅是有效的讨论。

    "If Sol is supposedly world-endingly dangerous, shouldn't GLM 5.2 be 90%…? Why aren't we seeing catastrophic GLM-enabled hacks every day now?" – @red_green_yell

  • 警报拉响 – 几位评论者将此次暂停是为了“煤矿里的金丝雀”,强调前沿模型正在达到一个点,即进一步的进展在本质上感觉很危险。

    "We’re hitting the frontier of the frontier where we can’t go further because it’s literally getting dangerous to go further." – @bottlepalm

  • 安全第一视角 – 一些人认为,真正的核心问题是运维安全:组织必须加强自身的系统,因为 AI 威胁只是众多向量之一。

    "OpenAI knocking is at harmless, but Russians and Chinese are already likely in if you do not do your job." – @miohtama

  • Implementation 批评 – 许多用户质疑为什么 OpenAI 没有已经采用硬化/强化沙箱技术(例如 gVisor, Firecracker),并暗示宣布的防护措施是一种反应性设计,而非主动设计。

    "Why didn't they use gVisor, Firecracker, seccomp…? It feels inexcusable for a company with effectively unlimited tokens." – @insanitybit

  • Process 流程透明度 – 评论者强调了缺乏对齐效果的的量化指标,并要求提供关于新监控和对齐流水线表现如何的更清晰证据。

    "Is there any reliable way to evaluate how well ‘alignment’ actually works?" – @musicale


OpenAI 及该领域的发展趋势

OpenAI 正在计划将这些防护措施整合进一个更新的 Preparedness Framework(准备就绪框架),该框架将涵盖训练和部署阶段。该实验室也打算在未来几周内让外部合作伙伴参与进来,并发布一份关于其发现的技术报告。

更广泛的 AI 社区面临着共同挑战:开发可扩展的监控、对齐和安全方法,以跟上模型能力的快速进步。OpenAI 的暂停信号表明,行业可能需要采取类似的预防性措施,随着模型接近网络关键能力阈值。


关键要点

  • OpenAI 在早期证据表明 Astra 可能具备关键网络能力后,停止了其最大的前沿 RL 训练任务。
  • 新的防护措施包括更严格的链式沙箱、网络隔离、持续安全测试、具有 30 分钟响应窗口的多阶段监控,以及扩展的对齐研究。
  • Hacker News 社区对于此次暂停是必要的安全步骤,还是质疑 OpenAI 安全实现措施的 adequacy 性的与时效性,看法不一。
  • 持续的透明度与外部协作将对于 AI 领域管理新兴的网络关键风险至关重要。

Sources

相关