microsoft/SPTAG
A distributed approximate nearest neighborhood search (ANN) library which provides a high quality vector index build, search and distributed online serving toolkits for large scale vector search scenario.
해결하는 문제
SPTAG은 대규모 벡터 근사 최근접 이웃(ANN) 검색을 위해 설계되었습니다. L2 또는 코사인 거리 기준으로, 거대한 데이터셋 내에서 주어진 쿼리 벡터와 가장 유사한 벡터를 효율적으로 찾을 수 있습니다.
작동 방식
이 라이브러리는 공간 분할 트리와 상대 이웃 그래프(RNG)를 결합하여 검색을 최적화합니다. 주로 두 가지 방법을 제공합니다:
- SPTAG-KDT: kd-트리와 RNG를 사용하며, 인덱스 생성 과정에서 더 효율적입니다.
- SPTAG-BKT: 균형 잡힌 k-평균 트리와 RNG를 사용하며, 매우 고차원 데이터에 대해 더 높은 검색 정확도를 제공합니다.
검색 과정은 공간 분할 트리를 사용해 초기 시드 벡터를 찾은 후, RNG 내에서 반복적으로 검색하여 결과를 정밀화합니다.
대상 사용자
10억 규모의 데이터셋을 다루는 고차원 벡터 데이터셋을 다루는 개발자 및 연구자들.
주요 특징
- 최신 업데이트: 온라인 벡터 삽입 및 삭제를 지원합니다.
- 분산 서빙: 여러 머신에 걸쳐 검색을 제공할 수 있습니다.
- 세부 거리 메트릭: L2 및 코사인 거리 모두 지원합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트