google/magika

Fast and accurate AI powered file content types detection

解決了什麼問題

Magika 是一款由 AI 驅動的工具,旨在准确识别文件的内容类型,无论其扩展名或名称为何。它解决了文件识别不可靠的问题,为传统方法提供了一个高精度的替代方案,特别是针对文本内容类型。

运作原理

Magika 使用自定义且高度优化的深度学习模型(大小仅几 MB),通过分析文件内容的有限子集来判断其类型。该模型是在包含超过 200 种内容类型的约 1 亿个样本数据集上训练而成的。该工具采用针对每种内容类型的阈值系统,以及可调节的预测模式(高置信度、中置信度及最佳猜测),以控制错误容忍度。

适用对象

适用于需要大规模、快速且精确进行文件识别的安全研究人员、开发人员和系统管理员。Google 已将其用于 Gmail、Drive 和 Safe Browsing,以便将文件路由至适当的安全扫描器。

亮点

  • 高准确度:在测试集上实现了约 99% 的平均精确率和召回率。
  • 快速推理:模型加载后,单个文件在单个 CPU 上的推理时间约为 5ms。
  • 多语言支持:提供基于 Rust 的 CLI、Python API 以及 JavaScript/TypeScript 和 Go 的绑定。
  • 可扩展性:能够同时处理数千个文件或递归扫描目录。
  • 高效:由于仅处理内容的有限子集,因此无论文件大小如何,推理时间几乎是恒定的。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目