google/magika

Fast and accurate AI powered file content types detection

解決する課題

Magikaは、拡張子やファイル名に関係なく、ファイルのコンテンツタイプを正確に識別するために設計されたAI駆動のツールです。これにより、従来の識別方法では信頼性が低かった問題に対処し、特にテキスト形式のコンテンツに対して高精度な代替手段を提供します。

仕組み

Magikaは、カスタマイズされ高度に最適化されたディープラーニングモデル(サイズは数MB)を使用し、ファイルの内容の限定されたサブセットを分析してそのタイプを判定します。このモデルは、バイナリ形式とテキスト形式の両方をカバーする、200種類以上のコンテンツタイプを含む約1億個のサンプルデータセットを使用してトレーニングされています。このツールは、コンテンツタイプごとの閾値システムと、エラー許容度を制御するための調整可能な予測モード(高信頼度、中信頼度、ベスト猜測)を採用しています。

対象となる方

大規模かつ迅速なファイル識別を必要とするセキュリティ研究者、開発者、およびシステム管理者向けです。Googleは、Gmail、Drive、Safe Browsingにおけるファイルのルーティングを適切なセキュリティスキャナーに振り分けるためにこれを利用しています。

ハイライト

  • 高精度: テストセットにおいて約99%の平均適合率と再現率を達成。
  • 高速な推論: モデルのロード後、単一のCPUでファイルあたり約5msの推論時間。
  • マルチ言語サポート: RustベースのCLI、Python API、およびJavaScript/TypeScriptとGo用のバインディングとして提供。
  • スケーラビリティ: 数千のファイルを同時に処理したり、ディレクトリを再帰的にスキャンしたりすることが可能。
  • 効率的: コンテンツの限定されたサブセットのみを処理するため、ファイルサイズに関わらず推論時間はほぼ一定です。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト