Hugging Face 與 Protect AI 安全合作夥伴關係:六個月進度報告

掃描規模與影響

  • 已掃描模型總數: 4.47 百萬個唯一模型版本,遍及 1.41 百萬個倉庫。
  • 已識別威脅: 在 51,700 個模型中發現 352,000 個不安全或可疑問題。
  • 效能: 在過去 30 天內處理了 2.26 億個請求,平均回應時間為 7.94 毫秒。

新的威脅偵測模組

  1. PAIT-ARV-100: 偵測在載入時可能寫入檔案系統的 archive slip。
  2. PAIT-JOBLIB-101: 偵測在載入時於 Joblib 模型中執行的可疑程式碼。
  3. PAIT-TF-200: 識別 TensorFlow SavedModels 中的架構後門。
  4. PAIT-LMAFL-300: 偵測 Llamafile 格式在推論期間的惡意程式碼執行。

此外,Guardian 現在能偵測 Keras 中的高嚴重性 CVE-2025-1550 漏洞。

零信任模型安全方法

Guardian 採用零信任方法,將任意程式碼執行視為本質上不安全,無論使用者意圖為何。此策略是必要的,因為攻擊者常利用混淆——例如壓縮、編碼與序列化——將惡意載荷隱藏在看似無害的腳本或框架可擴充元件中。透過在 InsightsDB 上將執行風險標記為「可疑」,Guardian 能減輕那些透過簡單載荷檢查無法偵測的風險。

機器學習模型的常見攻擊主題

透過研究與 huntr 漏洞懸賞計畫(已提供超過 200 份報告),Protect AI 識別出多個重複出現的攻擊向量:

依賴函式庫的攻擊鏈

這些攻擊利用使用者環境中常見的機器學習函式庫(例如 PyTorch、Numpy、Pandas)的函式。影響程度與函式庫的流行度成正比;例如,PyTorch 的 torchvision.io 函式可被利用來覆寫或刪除受害者系統上的檔案。

載荷混淆

攻擊者使用壓縮與序列化來繞過掃描器。Joblib 與 Keras 等格式可嵌入壓縮載荷或巢狀壓縮檔,讓使用者面臨 TarSlip 或 ZipSlip 漏洞,可能導致服務阻斷或透過路徑遍歷執行任意程式碼。

框架可擴充性漏洞

機器學習框架提供自訂層與基於設定的程式碼載入等機制,形成攻擊向量。Keras 中的 CVE-2025-1550 展示了即使有現有安全功能,自訂層仍可被利用進行任意程式碼執行。

攻擊向量鏈接

高階攻擊者結合多個漏洞(例如將混淆載荷與框架擴充機制結合),形成在單獨觀察時看似無害的複雜入侵路徑。

加強的偵測能力

  • 深層結構分析: PyTorch 與 Pickle 的掃描器現在會檢查執行路徑,以識別由函式庫相依性觸發的惡意模式。
  • 多層分析: Guardian 會解壓縮巢狀壓縮檔並檢查壓縮載荷,以發現 Joblib 與 Keras 等格式中隱藏的惡意程式碼。
  • 框架分析: 偵測模組現在分析機器學習框架的擴充機制,以阻止危險的實作,並在公開前即識別 CVE-2025-1550。
  • 擴充格式支援: 現已涵蓋 Joblib、TensorFlow(針對架構後門)以及 Llamafile。

社群驅動的安全

Protect AI 的威脅研究由 huntr(AI/ML 漏洞懸賞計畫)增強。擁有超過 17,000 名安全研究人員,社群已貢獻超過 200 份模型檔案漏洞報告,這些報告會自動整合至 Hugging Face Hub 上的 Guardian 掃描流程。

Sources