deepfates/memery
Search over large image datasets with natural language and computer vision
解決する課題
Memeryは、ファイル名が役に立たない、あるいは不明な大量の画像フォルダを手動で検索するという問題を解決します。何百ものサムネイルをスクロールする代わりに、ユーザーは自然言語による説明を使用して特定の画像を見つけることができます。
仕組み
このプロジェクトは、画像とテキストの両方を同じ潜在空間にマッピングするOpenAIのCLIP (Contrastive Language-Image Pretraining) transformerを使用しています。これにより、システムはテキストクエリ(例:「左を向いている女性の線画」)とローカルフォルダ内の画像を比較し、最も関連性の高い一致を見つけることができます。
対象者
ミーム、スクリーンショット、データセット、製品写真など、ファイル名や日付に頼らずに検索する方法を必要とする、大量のローカル画像コレクションを持つすべての人を対象としています。
特徴
- マルチインターフェース: ブラウザベースのGUI、コマンドラインインターフェース (CLI)、および他のワークフローに統合するためのPythonライブラリを提供します。
- 柔軟なクエリ: テキストクエリ、画像クエリ、またはその両方の組み合わせによる検索をサポートしています。
- インデックス作成: より効率的な検索のために、画像をエンコードしてインデックスを作成する
buildコマンドが含まれています。 - Notebook対応: GUI機能を含め、Jupyter notebooks内で使用できます。