google/magika
Fast and accurate AI powered file content types detection
해결하는 문제
Magika는 확장자나 파일 이름에 관계없이 파일의 콘텐츠 유형을 정확하게 식별하도록 설계된 AI 기반 도구입니다. 이는 파일 식별의 신뢰성 문제를 해결하며, 특히 텍스트 콘텐츠 유형에 대해 기존 방식의 고정밀 대안을 제공합니다.
작동 원리
Magika는 맞춤형으로 고도로 최적화된 딥러닝 모델(크기 수 MB)을 사용하여 파일 콘텐츠의 제한된 하위 집합을 분석하여 유형을 결정합니다. 이 모델은 바이너리 및 텍스트 형식을 모두 포함하는 약 1억 개의 샘플 데이터 세트를 사용하여 학습되었습니다. 이 도구는 콘텐츠 유형별 임계값 시스템과 오류 허용 범위를 제어하기 위한 조정 가능한 예측 모드(높은 신뢰도, 중간 신뢰도, 최적 추측)를 채택하고 있습니다.
대상
대규모의 빠르고 정확한 파일 식별이 필요한 보안 연구자, 개발자 및 시스템 관리자를 대상으로 합니다. Google은 Gmail, Drive 및 Safe Browsing에서 파일을 적절한 보안 스캐너로 라우팅하기 위해 이 도구를 사용합니다.
주요 특징
- 높은 정확도: 테스트 세트에서 약 99%의 평균 정밀도 및 재현율 달성.
- 빠른 추론: 모델 로드 후 단일 CPU에서 파일당 약 5ms의 추론 시간 소요.
- 다국어 지원: Rust 기반 CLI, Python API 및 JavaScript/TypeScript 및 Go용 바인딩 제공.
- 확장성: 수천 개의 파일을 동시에 처리하거나 디렉토리를 재귀적으로 스캔할 수 있음.
- 효율성: 콘텐츠의 제한된 하위 집합만 처리하므로 파일 크기에 관계없이 추론 시간이 거의 일정함.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트