Anthropic 關於偵測與防止蒸餾攻擊的報告

Anthropic 揭露了三個 AI 實驗室——DeepSeek、Moonshot 與 MiniMax——進行的大規模工業級行動,旨在非法提取 Claude 的能力以改進其自身的模型。這些實驗室利用約 24,000 個欺詐帳號產生了超過 1,600 萬次對話,違反了服務條款與區域存取限制。

非法蒸餾的機制與風險

蒸餾(Distillation)是一種合法的訓練方法,即使用能力較弱的模型在較強模型的輸出上進行訓練。然而,非法蒸餾允許競爭對手在極短的時間與成本內獲得強大的能力,而無需進行獨立開發。

國家安全與安全風險

非法蒸餾的模型通常缺乏前沿模型中內建的關鍵防護措施。這造成了重大的國家安全風險,因為危險的能力——例如用於開發生物武器或進行惡意網路活動的能力——可能在缺乏保護的情況下擴散。這些未受保護的能力可能被整合到軍事、情報與監控系統中,使威權政府能夠進行攻擊性網路行動、大規模監控與虛假訊息活動。

對出口管制之影響

蒸餾攻擊削弱了旨在維持 AI 競爭優勢的美國出口管制。Anthropic 指出,外國實驗室的快速進步往往並非源於獨立創新,而是依賴於從美國模型中提取的能力。由於大規模執行這些攻擊需要先進晶片,限制晶片存取仍然是限制直接模型訓練以及非法蒸餾規模的關鍵工具。

特定蒸餾行動之分析

Anthropic 根據 IP 地址關聯、請求元數據、基礎設施指標以及產業夥伴的證實,將三項不同的行動歸因於特定的實驗室。每項行動都針對 Claude 最具差異化的能力,包括代理推理(agentic reasoning)、工具使用與程式碼編寫。

DeepSeek

DeepSeek 進行了超過 150,000 次對話,針對推理能力、用於強化學習的基於量規的評分(rubric-based grading),以及建立針對政策敏感查詢的「去審查」替代方案。

關鍵技術包括:

  • Chain-of-Thought Generation:引導 Claude 逐步闡述其內部推理過程,以建立訓練數據。
  • Censorship Steering:利用 Claude 生成關於異議人士或威權主義查詢的替代方案,以訓練模型避開受審查的話題。
  • Coordinated Traffic:利用同步流量、共享支付方式以及跨帳號的「負載平衡」,以增加吞吐量並避免偵測。

Moonshot AI

Moonshot (Kimi models) 執行了超過 340 萬次對話,重點關注代理推理、工具使用、程式碼編寫、數據分析、電腦使用代理(computer-use agent)開發以及電腦視覺。 Moonshot 使用了數百個欺詐帳號,隨後嘗試提取並重建 Claude 的推理軌跡。

MiniMax

MiniMax 進行了超過 1,300 萬次對話,針對代理程式碼編寫、工具使用與編排(orchestration)。Anthropic 在該行動仍處於活躍狀態時便偵測到了它,並觀察到 MiniMax 在新的 Claude 模型發布後的 24 小時內便轉向其流量,以獲取最新系統的能力。

蒸餾者如何規避存取控制

由於 Anthropic 並未在中國或向中國公司的海外子公司提供 Claude 的商業存取權,攻擊者使用了商業代理服務。這些服務採用「九頭蛇集群」(hydra cluster)架構——由大量欺詐帳號組成的龐大網絡,將流量分散到 API 與第三方雲端平台,以消除單點故障。

在一個案例中,單一代理網絡同時管理著超過 20,000 個欺詐帳號,將蒸餾流量與合法的客戶請求混合在一起,以掩蓋其操作。

偵測與應對策略

Anthropic 正在實施多層防禦來識別與緩解蒸餾攻擊:

  • Detection Systems:開發分類器與行為指紋識別,以識別如 chain-of-thought 誘導與大規模帳號間的協同活動等模式。

  • Intelligence Sharing:與其他 AI 實驗室、雲端供應商及政府當局分享技術指標。

  • Access Controls:加強對教育帳號、安全研究計畫與新創組織的驗證,因為這些是常見的利用路徑。

  • Countermeasures:開發產品、API 與模型層級的防護措施,以降低非法蒸餾輸出的效能,同時不影響合法用戶。

Sources

相關