OpenAI 破坏协同模型蒸馏活动

摘要

OpenAI 检测并阻止了一次协同对抗性蒸馏活动,该活动试图从其模型中提取受保护的推理过程,展示了一种可以绕过安全防护并加速不安全能力转移的新型安全威胁。

发生了什么

  • 协同提取:从 7 月 1 日开始,操作者使用提示模式复制一次对话中的加密推理,并强制另一次对话中的模型将其揭示。该活动在 7 月 24 日至 25 日达到高峰,涉及 超过 4,000 名用户 的 16,000 次请求,随后涉及 超过 15,000 名用户,直到 7 月 28 日被完全阻止。
  • 未破坏基础设施:攻击者从未破解 OpenAI 的加密、访问数据库或获取原始用户对话日志。他们操纵模型交互以揭示通常从最终答案中隐藏的隐藏推理。
  • 归因:OpenAI 将活动的核心集群与 Moonshot AI(Kimi 模型的创建者)相关的个人联系起来,但无法确认所有行为者都是同一群体。

为何重要

  • 安全风险:提取的推理可用于训练新模型,而无需原始系统中存在的安全缓解措施,可能以较低成本创建不安全副本。
  • 国家安全关切:大规模蒸馏可能加速高级能力的传播,尤其是在双重用途领域,而无需对源模型进行监督。
  • 行业广泛相关性:该技术并非 OpenAI 特有;类似攻击可能影响任何存储或流式传输隐藏推理工件的前沿模型。

攻击的技术细节

  • 对抗性蒸馏:攻击者利用模型的内部“受保护推理”——用于达成答案的思维链的加密记录。通过提示模型解密和转录此隐藏内容,他们以可读形式获得了推理。
  • 跨对话重放:操作者复制一个用户对话中的加密推理,并将其注入另一个对话,有效地重放隐藏工件。
  • 基于模式的自动化:该活动由特定提示模式驱动,可跨数千个账户扩展,实现高容量提取。

OpenAI 部署的缓解措施

  1. 账户执法:欺诈账户被禁止或限制,注册/基础设施控制得到加强。
  2. 技术控制:
    • 关闭了允许恢复加密推理的重放路径。
    • 添加了流式输出检查,以保留可能暴露隐藏推理的任何输出。
    • 扩展了对所有模型系列中识别出的提示模式的监控。
  3. 合作伙伴协调:
    • 与第三方服务提供商合作,识别并破坏使用其平台的账户。
    • 与前沿模型论坛和政府信息共享渠道分享调查结果。

行业响应与协作

  • OpenAI 通过前沿模型论坛向行业合作伙伴传达了攻击向量,鼓励集体防御。
  • 独立安全研究人员发表了一篇相关论文(arXiv 2608.09867),识别了跨模型和对话压缩漏洞;OpenAI 验证了这些发现并将其纳入其缓解路线图。

未来展望

  • 不断演变的威胁:随着前沿模型变得更强,对抗性蒸馏尝试预计将变得更加复杂和规模化。
  • 持续工作:
    • 加强第一方和合作伙伴托管部署中隐藏推理的技术保护。
    • 增强工具输出防御、分类器覆盖范围和模型拒绝机制。
    • 继续与行业和政府共享威胁信息,以尽早检测协同活动。

关键要点

  • 对抗性蒸馏是一种真实、可扩展的威胁,可以通过提取内部推理绕过现有安全层。
  • OpenAI 的快速检测、缓解和透明披露为行业范围内的防御类似攻击提供了模板。
  • 持续、分层防御和跨部门协作对于保护前沿 AI 系统免受未经授权的能力复制至关重要。

Sources