jabberjabberjabber/ImageIndexer

Creates an index of images, queries a local LLM and adds tags to the image metadata

해결하는 문제

LLMII는 대규모 이미지 컬렉션에 수동으로 레이블을 지정하고 인덱싱하는 문제를 해결하기 위해 설계되었습니다. 캡션과 키워드를 수동으로 입력하는 대신, 로컬 시각 언어 모델을 사용하여 디렉토리 트리 내 이미지에 대한 설명적 메타데이터를 자동으로 생성하므로, 표준 메타데이터 호환 도구를 사용하여 이미지를 검색하고 정리할 수 있습니다.

작동 방식

이 도구는 KoboldCpp를 통해 사용자의 로컬 머신에서 시각 언어 모델(VLM)을 실행합니다. 이미지를 분석하여 각 파일에 대한 키워드 목록과 캡션을 생성합니다. 이 정보는 ExifTool을 사용하여 이미지의 메타데이터에 직접 기록되거나 사이드카 XMP 파일에 저장됩니다. 파일 재처리를 방지하기 위해 도구는 특정 메타데이터 필드(Identifier 및 Status)를 사용하여 각 이미지의 처리 상태를 추적합니다.

대상 사용자

클라우드 서비스나 외부 데이터베이스에 의존하지 않고 이미지 태깅 및 캡션 생성을 자동화하고자 하며, 데이터와 처리를 완전히 로컬로 유지하고자 하는 사진작가 및 디지털 자산 관리자에게 적합합니다.

주요 특징

  • 로컬 AI 처리: 프라이버시를 보장하고 클라우드 의존성을 없애기 위해 GPU 가속(Apple Metal, Nvidia CUDA 또는 AMD Vulkan)을 사용하여 기기에서 완전히 작동합니다.
  • 메타데이터 통합: 일반적인 메타데이터 필드(MWG:Keyword, MWG:Description)에 기록하며, 해시된 파일에 대한 사이드카 파일을 지원합니다.
  • 다양한 포맷 지원: 주요 RAW 카메라 파일을 포함한 광범위한 이미지 포맷과 호환됩니다.
  • 높은 구성 가능성: 샘플러 옵션(temperature, top_p, top_k), 이미지 크기 및 키워드 정리 규칙(예: 단수형 변환)에 대해 세부적인 제어를 제공합니다.
  • 크로스 플랫폼: Windows, macOS (ARM) 및 Linux에서 작동합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트