jabberjabberjabber/ImageIndexer
Creates an index of images, queries a local LLM and adds tags to the image metadata
解決的問題
LLMII 旨在解決大規模圖像集合的手動標記和索引問題。它不再需要手動輸入說明文字和關鍵字,而是使用本地視覺語言模型自動為目錄樹中的圖像生成描述性元數據,從而可以使用任何標準的元數據相容工具進行搜尋和整理。
工作原理
該工具透過 KoboldCpp 在使用者的本地機器上執行視覺語言模型 (VLM)。它分析圖像並為每個檔案生成關鍵字列表和說明文字。這些資訊隨後透過 ExifTool 直接寫入圖像的元數據中,或者儲存到側邊欄 XMP 檔案中。為了避免重複處理檔案,該工具使用特定的元數據欄位(Identifier 和 Status)來追蹤每張圖像的處理狀態。
適用對象
適用於希望在不依賴雲端服務或外部資料庫的情況下實現圖像標籤和說明文字自動化的攝影師和數位資產管理者,並且希望將數據和處理過程完全保留在本地。
亮點
- 本地 AI 處理:利用 GPU 加速(Apple Metal、Nvidia CUDA 或 AMD Vulkan)完全在裝置上執行,以確保隱私並無需依賴雲端。
- 元數據整合:寫入常用元數據欄位(MWG:Keyword, MWG:Description),並支援為雜湊檔案提供側邊欄檔案。
- 多格式支援:相容廣泛的圖像格式,包括主要的 RAW 相機檔案。
- 高度可配置:提供對取樣器選項(temperature, top_p, top_k)、圖像尺寸和關鍵字清理規則(例如:單複數轉換)的詳細控制。
- 跨平台:支援 Windows、macOS (ARM) 和 Linux。
相關
- 專案
- 專案
- 專案
- 專案
- 專案