vearch/vearch

Distributed vector search for AI-native applications

What it solves

Vearch 提供一个云原生、分布式的向量数据库,专为处理 AI 应用所需的嵌入向量相似度搜索而设计。它解决了在数百万对象中快速检索的需求,并且能够在分布式环境中扩展与保持可靠性。

How it works

Vearch 使用由三个主要组件组成的分布式架构:

  • Master:管理 schema、集群级别的 metadata 与资源协调。
  • Router:处理 RESTful API 请求(upsert、delete、search、query),负责路由请求并合并结果。
  • PartitionServer (PS):以 Raft 为基础的复制方式存储文档分区。它使用“Gamma”——基于 Faiss 的核心向量搜索引擎,来存储、索引与检索向量和标量。

Who it’s for

此项目面向需要可扩展内存后端的 AI 应用开发者,例如使用 Langchain、LlamaIndex,或构建大规模视觉搜索系统的开发者。

Highlights

  • Hybrid Search:同时支持向量相似度搜索和标量过滤。
  • High Performance:能够在毫秒级别从数百万对象中检索结果。
  • Scalability:具备复制与弹性水平扩展功能。
  • Broad Integration:提供 Python、Go、Java、Rust SDK,并可与 Langchain、LlamaIndex 等热门框架集成。