jabberjabberjabber/ImageIndexer

Creates an index of images, queries a local LLM and adds tags to the image metadata

解决的问题

LLMII 旨在解决大规模图像集合的手动标记和索引问题。它不再需要手动输入说明文字和关键词,而是使用本地视觉语言模型自动为目录树中的图像生成描述性元数据,从而可以使用任何标准的元数据兼容工具进行搜索和整理。

工作原理

该工具通过 KoboldCpp 在用户的本地机器上运行视觉语言模型 (VLM)。它分析图像并为每个文件生成关键词列表和说明文字。这些信息随后通过 ExifTool 直接写入图像的元数据中,或者保存到侧边栏 XMP 文件中。为了避免重复处理文件,该工具使用特定的元数据字段(Identifier 和 Status)来跟踪每张图像的处理状态。

适用对象

适用于希望在不依赖云服务或外部数据库的情况下实现图像标签和说明文字自动化的摄影师和数字资产管理者,并且希望将数据和处理过程完全保留在本地。

亮点

  • 本地 AI 处理:利用 GPU 加速(Apple Metal、Nvidia CUDA 或 AMD Vulkan)完全在设备上运行,以确保隐私并无需依赖云端。
  • 元数据集成:写入常用元数据字段(MWG:Keyword, MWG:Description),并支持为哈希文件提供侧边栏文件。
  • 多格式支持:兼容广泛的图像格式,包括主要的 RAW 相机文件。
  • 高度可配置:提供对采样器选项(temperature, top_p, top_k)、图像尺寸和关键词清理规则(例如:单复数转换)的详细控制。
  • 跨平台:支持 Windows、macOS (ARM) 和 Linux。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目