supervc-stack/VectorChord
Scalable, fast, and disk-friendly vector search in Postgres, the successor of pgvecto.rs.
What it solves
VectorChord 解决了千亿级向量数据库的高成本和资源密集问题。它使用户能够在相对普通的硬件上存储和搜索数亿至数十亿的向量,与其他向量搜索方案相比,显著降低基础设施费用。
How it works
它实现为 PostgreSQL 扩展,通过多项关键技术优化向量的存储与检索:
- RaBitQ Compression:使用原生 4 位 (RaBitQ4) 和 8 位 (RaBitQ8) 向量类型,极大降低内存和存储占用,同时保持高搜索精度。
- Autonomous Reranking:将压缩与重新排序结合,以保持搜索质量。
- Hierarchical K-means:加速索引构建,使 1 亿向量可在约 20 分钟内完成索引。
- Dimensionality Reduction and Sampling:在索引过程中控制内存增长,使拥有 128GB RAM 的机器也能创建千亿向量索引。
Who it’s for
开发者和组织需要将向量搜索规模扩展到数亿或数十亿的嵌入向量,而不承担巨大的云基础设施成本,尤其是已经使用或希望集成 PostgreSQL 的用户。
Highlights
- Cost Efficiency:能够在单个 AWS i4i.xlarge 实例上托管 1 亿向量。
- PostgreSQL Integration:完全兼容 pgvector 数据类型和语法,便于迁移。
- High-Speed Indexing:利用优化的磁盘操作和层次 K-means,快速为大规模数据集构建索引。
- Low-Bit Quantization:提供原生 4 位和 8 位类型,最小化空间占用且不会显著降低召回率。