google/magika
Fast and accurate AI powered file content types detection
解決了什麼問題
Magika 是一款由 AI 驅動的工具,旨在準確識別檔案的內容類型,無論其副檔名或名稱為何。它解決了檔案識別不可靠的問題,為傳統方法提供了一個高精度的替代方案,特別是針對文本內容類型。
運作原理
Magika 使用自定義且高度優化的深度學習模型(大小僅幾 MB),透過分析檔案內容的有限子集來判斷其類型。該模型是在包含超過 200 種內容類型的約 1 億個樣本數據集上訓練而成的,涵蓋了二進位和文本格式。該工具採用了針對每種內容類型的閾值系統,以及可調整的預測模式(高置信度、中置信度及最佳猜測),以控制錯誤容忍度。
適用對象
適用於需要大規模、快速且精確進行檔案識別的安全研究人員、開發人員和系統管理員。Google 已將其用於 Gmail、Drive 和 Safe Browsing,以便將檔案路由至適當的安全掃描器。
重點
- 高準確度:在測試集上實現了約 99% 的平均精準率與召回率。
- 快速推論:模型載入後,單個檔案在單個 CPU 上的推論時間約為 5ms。
- 多語言支持:提供基於 Rust 的 CLI、Python API 以及 JavaScript/TypeScript 和 Go 的綁定。
- 可擴展性:能夠同時處理數千個檔案或遞迴掃描目錄。
- 高效能:由於僅處理內容的有限子集,因此無論檔案大小如何,推論時間幾乎是恆定的。
相關
- 專案
- 專案
- 專案
- 專案
- 專案