TechyNilesh/DeepImageSearch

DeepImageSearch is a Python library for fast and accurate image search. It offers seamless integration with Python, GPU support, and advanced capabilities for identifying complex image patterns using the Vision Transformer models.

解決的問題

DeepImageSearch 是一個 Python 庫,旨在簡化 AI 驅動的影像搜尋系統的建構。它消除了管理多模態嵌入、向量索引和元資料儲存的複雜性,讓使用者能透過自然語言(文字到影像)、視覺上相似的影像(影像到影像),或兩者的組合(混合搜尋)來尋找影像。

工作原理

該庫使用多模態嵌入模型(如 CLIP、SigLIP 和 EVA-CLIP)將影像與文字轉換至共享向量空間。隨後使用向量儲存(FAISS、ChromaDB 或 Qdrant)對這些向量進行索引,並透過元資料儲存(JSON 或 PostgreSQL)追蹤影像細節。

主要組件包括:

  • Embedding Manager:負責從影像與文字產生向量。
  • Indexer:處理影像,並透過 OpenAI 相容 API 使用 LLM 選擇性產生說明文字。
  • Hyrbid Search:使用加權融合結合文字與影像查詢以優化結果。
  • Agentic Integration:提供 Claude 用的 MCP 伺服器與 LangChain 工具,讓 AI 代理(如 Claude)能執行影像搜尋。

適用對象

需要基於語意而非僅檔案名或標籤高效檢索視覺資產的影像中心型應用、AI 代理與 RAG 流水線的開發者。

特色亮點

  • 多模態搜尋:支援文字到影像、影像到影像與混合搜尋模式。
  • 彈性向量儲存:開箱即用支援 FAISS、ChromaDB 與 Qdrant。
  • LLM 說明文字生成:使用任何 OpenAI SDK 相容提供者自動為影像產生說明文字。
  • 代理就緒:內建用於 Claude 的 MCP 伺服器與用於代理工作流程的 LangChain 工具。
  • 生產級元資料:支援 PostgreSQL 以實現可擴展的影像記錄管理。
  • 硬體加速:自動偵測並支援 CUDA、MPS(Apple Silicon)與 CPU。

相關

  • 專案
  • Dispatch
  • 專案
  • 專案
  • 專案