Anthropic 关于检测与预防蒸馏攻击的报告
Anthropic 发现,DeepSeek、Moonshot 和 MiniMax 这三家 AI 实验室正在进行工业规模的行动,旨在非法提取 Claude 的能力以改进其自身模型。这些实验室利用约 24,000 个欺诈账户生成了超过 1,600 万次交互,违反了服务条款和地区访问限制。
非法蒸馏的机制与风险
蒸馏是一种合法的训练方法,即使用能力较弱的模型在更强大的模型的输出上进行训练。然而,非法蒸馏允许竞争对手在极短的时间和成本内获得强大的能力,而无需进行独立开发。
国家安全与安全风险
非法蒸馏的模型通常缺乏前沿模型中内置的关键保护措施。这带来了重大的国家安全风险,因为危险能力——例如用于开发生物武器或进行恶意网络活动的能力——可能会在缺乏保护的情况下扩散。这些不受保护的能力可能会被集成到军事、情报和监控系统中,从而使威权政府能够进行进攻性网络操作、大规模监控和虚假信息宣传。
对出口管制的影响
蒸馏攻击破坏了旨在维持 AI 竞争优势的美国出口管制。Anthropic 指出,外国实验室的快速进步往往不是独立创新的结果,而是依赖于从美国模型中提取的能力。由于大规模执行这些攻击需要先进的芯片,限制芯片获取仍然是限制直接模型训练和非法蒸馏规模的关键工具。
特定蒸馏行动的分析
Anthropic 根据 IP 地址关联、请求元数据、基础设施指标以及行业合作伙伴的证实,将三场不同的行动归因于特定的实验室。每场行动都针对 Claude 最具差异化的能力,包括智能体推理、工具使用和编程。
DeepSeek
DeepSeek 进行了超过 150,000 次针对推理能力、基于评分标准的强化学习评分以及创建针对政策敏感查询的审查安全替代方案的交互。
关键技术包括:
- Chain-of-Thought Generation: 提示 Claude 分步阐述其内部推理过程,以创建训练数据。
- Censorship Steering: 使用 Claude 生成关于异见人士或威权主义的查询替代方案,以训练模型规避审查话题。
- Coordinated Traffic: 利用同步流量、共享支付方式以及跨账户的“负载均衡”来增加吞吐量并规避检测。
Moonshot AI
Moonshot (Kimi 模型) 执行了超过 340 万次交互,重点关注智能体推理、工具使用、编程、数据分析、计算机使用智能体开发以及计算机视觉。 Moonshot 使用了数百个欺诈账户,并随后试图提取并重构 Claude 的推理轨迹。
MiniMax
MiniMax 进行了超过 1,300 万次交互,针对智能体编程、工具使用和编排。Anthropic 在该行动仍在进行时就检测到了它,并观察到 MiniMax 在新的 Claude 模型发布后的 24 小时内便转向其流量,以获取最新系统的能力。
蒸馏者如何规避访问控制
由于 Anthropic 不在中国或向中国公司的海外子公司提供 Claude 的商业访问权限,攻击者使用了商业代理服务。这些服务采用“九头蛇集群”架构——由欺诈账户组成的庞大网络,将流量分布在 API 和第三方云平台中,以消除单点故障。
在一个案例中,单个代理网络同时管理着超过 20,000 个欺诈账户,将蒸馏流量与合法客户请求混合在一起,以掩盖其操作。
检测与响应策略
Anthropic 正在实施多层防御措施,以识别并缓解蒸馏攻击:
- Detection Systems: 开发分类器和行为指纹识别,以识别诸如思维链诱导和大规模账户量下的协调活动等模式。
- Intelligence Sharing: 与其他 AI 实验室、请云服务提供商和政府部门共享技术指标。
- Access Controls: 加强对教育账户、安全研究计划和初创组织账户的验证,因为这些是常见的利用路径。
- Countermeasures: 开发产品、API 和模型层面的保护措施,以降低非法蒸馏输出的效能,同时不影响合法用户。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch