huggingface/sentence-transformers
State-of-the-Art Embeddings, Retrieval, and Reranking
해결하는 문제
Sentence Transformers는 임베딩 생성, 검색, 재정렬을 간편하게 수행할 수 있는 프레임워크입니다. 복잡한 모델 아키텍처를 처음부터 구축할 필요 없이 텍스트(또는 기타 모달리티)를 밀도형 또는 스파스형 벡터로 변환하여 유사한 콘텐츠를 찾고, 검색 결과를 순위 매기며, 텍스트 유사도를 분석할 수 있도록 합니다.
작동 방식
이 프레임워크는 네 가지 주요 유형의 인코더 모델을 지원합니다:
- 임베딩 모델: 텍스트에 대한 밀도형 벡터를 생성하여 유사도 점수를 계산합니다.
- 재정렬 모델 (크로스엔코더): 텍스트 쌍의 유사도 점수를 예측하여 검색 결과를 정교화합니다.
- 스파스 인코더 모델: 어휘 기반 검색을 위한 스파스 임베딩을 생성합니다.
- 멀티벡터 인코더 모델: 토큰 수준의 임베딩을 사용하여 후기 상호작용 검색 (ColBERT 스타일)을 수행합니다.
Hugging Face 생태계와 통합되어 있으며, 15,000개 이상의 사전 학습된 모델에 접근할 수 있고, 의미 검색이나 동의어 마이닝과 같은 특정 작업을 위해 다양한 손실 함수를 사용한 모델 미세조정 도구도 제공합니다.
대상 사용자
최신 임베딩 및 재정렬 모델을 사용하여 의미 기반 검색, 클러스터링, 동의어 마이닝, 또는 검색-재정렬 파이프라인을 구현해야 하는 개발자 및 연구자.
주요 특징
- 다양한 모델 지원: BERT, RoBERTa, XLM-R, DistilBERT, Electra, BART 등을 지원합니다.
- 다중 모달 기능: 단일 API를 통해 텍스트, 이미지, 오디오, 비디오 모델을 사용할 수 있습니다.
- 풍부한 사전 학습 모델 라이브러리: MTEB 리더보드 모델을 포함한 수천 개의 모델에 접근 가능합니다.
- 학습 도구 제공: 임베딩 모델용 20개 이상의 손실 함수를 지원하는 포괄적인 미세조정 도구.
- 효율성 기술: Matryoshka 임베딩, 이진/스칼라 양자화, 정적 임베딩 모델을 지원하여 더 빠른 검색을 가능하게 합니다.
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch