TechyNilesh/DeepImageSearch
DeepImageSearch is a Python library for fast and accurate image search. It offers seamless integration with Python, GPU support, and advanced capabilities for identifying complex image patterns using the Vision Transformer models.
解决的问题
DeepImageSearch 是一个 Python 库,旨在简化 AI 驱动的图像搜索系统构建。它消除了管理多模态嵌入、向量索引和元数据存储的复杂性,使用户能够通过自然语言(文本到图像)、视觉上相似的图像(图像到图像),或两者的组合(混合搜索)来查找图像。
工作原理
该库使用多模态嵌入模型(如 CLIP、SigLIP 和 EVA-CLIP)将图像和文本转换到共享向量空间。然后使用向量存储(FAISS、ChromaDB 或 Qdrant)对这些向量进行索引,并通过元数据存储(JSON 或 PostgreSQL)跟踪图像详情。
主要组件包括:
- Embedding Manager:负责从图像和文本生成向量。
- Indexer:处理图像,并通过 OpenAI 兼容 API 使用 LLM 选择性生成描述。
- Hyrbid Search:使用加权融合结合文本和图像查询以优化结果。
- Agentic Integration:提供 Claude 用的 MCP 服务器和 LangChain 工具,使 AI 代理(如 Claude)能够执行图像搜索。
适用人群
需要基于语义而非仅文件名或标签高效检索视觉资产的图像中心型应用、AI 代理和 RAG 流水线的开发者。
特色亮点
- 多模态搜索:支持文本到图像、图像到图像和混合搜索模式。
- 灵活的向量存储:开箱即用支持 FAISS、ChromaDB 和 Qdrant。
- LLM 描述生成:使用任何 OpenAI SDK 兼容提供者自动为图像生成描述。
- 代理就绪:包含用于 Claude 的 MCP 服务器和用于代理工作流的 LangChain 工具。
- 生产级元数据:支持 PostgreSQL 以实现可扩展的图像记录管理。
- 硬件加速:自动检测并支持 CUDA、MPS(Apple Silicon)和 CPU。
相关
- 项目
- Dispatch
- 项目
- 项目
- 项目