Hugging Face 与 Protect AI 安全合作伙伴关系:6 个月进展报告
Hugging Face 与 Protect AI 于 2024 年 10 月建立合作,将 Protect AI 的 Guardian 扫描技术集成到 Hugging Face Hub 中。此合作旨在通过 Insights DB 为开发者提供内联安全警报和全面的漏洞报告,以保障机器学习(ML)供应链的安全。
扫描规模与影响
截至 2025 年 4 月 1 日,合作在模型安全扫描方面已实现以下规模:
- Total Models Scanned: 447 万个唯一模型版本,遍及 141 万个仓库。
- Threats Identified: 352,000 个不安全或可疑问题,分布在 51,700 个模型中。
- Performance: 最近 30 天内处理了 2.26 亿请求,平均响应时间为 7.94 毫秒。
新威胁检测模块
Protect AI 已推出四个新检测模块,以扩展覆盖的模型文件格式范围并识别复杂的混淆技术:
- PAIT-ARV-100: 检测在加载时可能写入文件系统的归档滑移(archive slip)漏洞。
- PAIT-JOBLIB-101: 检测在加载时 Joblib 模型中可疑的代码执行。
- PAIT-TF-200: 识别 TensorFlow SavedModels 中的架构后门。
- PAIT-LMAFL-300: 检测 Llamafile 格式在推理期间的恶意代码执行。
此外,Guardian 现在能够检测 Keras 中的高危漏洞 CVE-2025-1550。
零信任模型安全方法
Guardian 采用零信任方法,将任意代码执行视为本质上不安全,无论用户意图如何。之所以需要此策略,是因为攻击者常利用压缩、编码和序列化等混淆手段,将恶意负载隐藏在看似无害的脚本或框架可扩展组件中。通过在 InsightsDB 上将执行风险标记为“可疑”,Guardian 能够缓解那些通过简单负载检查难以发现的风险。
机器学习模型中的常见攻击主题
通过研究以及 huntr 漏洞赏金计划(已提供超过 200 份报告),Protect AI 识别出若干重复出现的攻击向量:
基于库的攻击链
这些攻击利用用户环境中常见机器学习库(如 PyTorch、Numpy、Pandas)的函数。其影响与库的流行程度成正比;例如,PyTorch 的 torchvision.io 函数可被利用来覆盖或删除受害者系统上的文件。
负载混淆
攻击者使用压缩和序列化来规避扫描器。Joblib 和 Keras 等格式可以嵌入压缩负载或嵌套归档,使用户面临 TarSlip 或 ZipSlip 漏洞的风险,这可能导致通过路径遍历实现拒绝服务或任意代码执行。
框架可扩展性漏洞
机器学习框架提供自定义层和基于配置的代码加载等机制,形成攻击向量。Keras 中的 CVE-2025-1550 展示了即使存在安全特性,自定义层仍可被利用进行任意代码执行。
攻击向量链式组合
高级攻击者会将多个漏洞组合(例如,将混淆负载与框架扩展机制相结合),形成在单独观察时看似无害的复杂妥协路径。
增强的检测能力
Guardian 已发展其检测能力以应对这些威胁:
- Deep Structure Analysis: 针对 PyTorch 和 Pickle 的扫描器现在检查执行路径,以识别由库依赖触发的恶意模式。
- Multi-layered Analysis: Guardian 解压嵌套归档并检查压缩负载,以发现 Joblib 和 Keras 等格式中隐藏的恶意代码。
- Framework Analysis: 检测模块现在分析机器学习框架的扩展机制,以阻止危险实现,并在公开披露前识别出 CVE-2025-1550。
- Expanded Format Support: 现在的覆盖范围包括 Joblib、TensorFlow(用于架构后门)以及 Llamafile。
社区驱动的安全
Protect AI 的威胁研究得到了 huntr——AI/ML 漏洞赏金计划的支持。社区拥有超过 17,000 名安全研究人员,已贡献超过 200 份模型文件漏洞报告,这些报告会自动集成到 Hugging Face Hub 上的 Guardian 扫描流程中。