jabberjabberjabber/ImageIndexer

Creates an index of images, queries a local LLM and adds tags to the image metadata

解決する課題

LLMIIは、大量の画像コレクションを手動でラベル付けし、インデックスを作成する問題を解決するために設計されています。キャプションやキーワードを手動で入力する代わりに、ローカルの視覚言語モデルを使用して、ディレクトリツリー内の画像に対して説明的なメタデータを自動生成します。これにより、標準的なメタデータ互換ツールを使用して、画像を検索可能かつ整理された状態にすることができます。

仕組み

このツールは、KoboldCppを介してユーザーのローカルマシン上で視覚言語モデル(VLM)を実行します。画像を分析し、各ファイルに対してキーワードのリストとキャプションを生成します。この情報は、ExifToolを使用して画像のメタデータに直接書き込まれるか、サイドカーXMPファイルに保存されます。ファイルの再処理を避けるため、ツールは特定のメタデータフィールド(IdentifierおよびStatus)を使用して、各画像の処理状態を追跡します。

対象者

クラウドサービスや外部データベースに依存せず、画像のタグ付けとキャプション作成を自動化したいフォトグラファーやデジタルアセットマネージャーで、データと処理を完全にローカルに保持したい方に適しています。

ハイライト

  • ローカルAI処理: プライバシーを確保し、クラウドに依存しないよう、GPUアクセラレーション(Apple Metal、Nvidia CUDA、またはAMD Vulkan)を使用して完全にデバイス上で動作します。
  • メタデータ統合: 一般的なメタデータフィールド(MWG:Keyword、MWG:Description)に書き込み、ハッシュ化されたファイルについてはサイドカーファイルをサポートします。
  • マルチフォーマット対応: 主要なRAWカメラファイルを含む、幅広い画像フォーマットに対応しています。
  • 高度な設定機能: サンプラーオプション(temperature、top_p、top_k)、画像サイズ、キーワードのクリーニングルール(例:単数形への変換)を詳細に制御できます。
  • クロスプラットフォーム: Windows、macOS (ARM)、およびLinuxで動作します。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト