supervc-stack/VectorChord

Scalable, fast, and disk-friendly vector search in Postgres, the successor of pgvecto.rs.

What it solves

VectorChord는 수십억 규모 벡터 데이터베이스의 높은 비용과 자원 집약 문제를 해결합니다. 비교적 보통 수준의 하드웨어에서도 수억~수십억 개의 벡터를 저장·검색할 수 있어, 다른 벡터 검색 솔루션에 비해 인프라 비용을 크게 절감합니다.

How it works

PostgreSQL 확장으로 구현되어 다음과 같은 핵심 기술을 통해 벡터 저장 및 검색을 최적화합니다:

  • RaBitQ Compression: 네이티브 4비트(RaBitQ4) 및 8비트(RaBitQ8) 벡터 타입을 사용해 메모리와 스토리지 사용량을 크게 줄이면서도 높은 검색 정밀도를 유지합니다.
  • Autonomous Reranking: 압축과 재랭킹을 결합해 검색 품질을 보존합니다.
  • Hierarchical K-means: 인덱스 구축을 가속화해 1억 개 벡터를 약 20분 안에 인덱싱합니다.
  • Dimensionality Reduction and Sampling: 인덱싱 과정에서 메모리 증가를 제어해 128GB RAM 머신에서도 수십억 벡터 인덱스를 생성할 수 있습니다.

Who it’s for

수억~수십억 개의 임베딩으로 벡터 검색을 확장하고자 하는 개발자와 조직을 위한 솔루션이며, 특히 이미 PostgreSQL을 사용 중이거나 통합을 원하는 경우 클라우드 인프라 비용을 크게 절감할 수 있습니다.

Highlights

  • Cost Efficiency: 단일 AWS i4i.xlarge 인스턴스에 1억 벡터를 호스팅할 수 있습니다.
  • PostgreSQL Integration: pgvector 데이터 타입 및 구문과 완전 호환되어 원활한 마이그레이션이 가능합니다.
  • High-Speed Indexing: 최적화된 디스크 작업과 계층적 K-means를 활용해 대규모 데이터셋의 인덱스를 빠르게 구축합니다.
  • Low-Bit Quantization: 네이티브 4비트·8비트 타입을 제공해 공간을 최소화하면서도 리콜 손실을 거의 발생시키지 않습니다.