Sentence Transformers가 Hugging Face에 합류합니다

Sentence Transformers가 Hugging Face로 이전합니다

Sentence Transformers는 TU Darmstadt의 Ubiquitous Knowledge Processing (UKP) Lab에서 Hugging Face로 이전하고 있습니다. 이번 이동을 통해 라이브러리는 Hugging Face의 인프라(지속적인 통합 및 테스트 포함)를 활용하여 정보 검색 및 자연어 처리(NLP) 분야의 최신 발전을 지속적으로 반영할 수 있습니다.

핵심 기능 및 채택

Sentence Transformers(또는 SentenceBERT, SBERT)는 의미를 포착하는 고품질 임베딩을 생성하는 오픈소스 라이브러리입니다. 주요 NLP 작업에 널리 활용됩니다:

  • Semantic Search: 키워드가 아닌 의미를 기반으로 문서를 찾습니다.
  • Semantic Textual Similarity: 두 텍스트가 얼마나 유사한지 측정합니다.
  • Clustering: 유사한 텍스트를 함께 그룹화합니다.
  • Paraphrase Mining: 동일한 내용의 패러프레이즈 버전을 식별합니다.

2025년 10월 현재, Hugging Face Hub에 16,000개가 넘는 Sentence Transformers 모델이 제공되고 있으며, 월간 고유 사용자 100만 명 이상이 이용하고 있습니다.

프로젝트 거버넌스 및 오픈소스 현황

Sentence Transformers는 Apache 2.0 라이선스 하에 커뮤니티 주도형 오픈소스 프로젝트로 유지됩니다. 프로젝트는 투명성, 협업, 광범위한 접근성을 계속 우선시할 것입니다. 2023년 말부터 라이브러리를 유지해 온 Hugging Face의 Tom Aarsen이 계속해서 프로젝트를 이끌 예정입니다.

기술 진화 및 역사

2019년 Dr. Nils Reimers가 Prof. Dr. Iryna Gurevych 아래 UKP Lab에서 소개한 이 라이브러리는 문장 수준 의미 작업을 위한 표준 BERT 임베딩의 한계를 극복하기 위해 만들어졌습니다. Siamese 네트워크 아키텍처를 활용해 코사인 유사도로 효율적으로 비교할 수 있는 임베딩을 생성했습니다.

  • 2020: 400개가 넘는 언어에 대한 다국어 지원 추가.
  • 2021: Cross Encoder 및 Sentence Transformer 모델을 통한 쌍별 문장 점수 지원 확대와 Hugging Face Hub와의 통합(v2.0).
  • Late 2023: 유지보수를 Tom Aarsen에게 이전하여 Sentence Transformer 모델의 현대화된 학습(v3.0), Cross Encoder 개선(v4.0), Sparse Encoder 모델(v5.0)이 도입되었습니다.

최근 기술 발전

Hugging Face의 유지보수 하에 라이브러리는 학습 API와 모델 지원을 확대했습니다:

  • Training APIs: 밀집 임베딩 모델, Cross Encoder(재정렬) 모델, Sparse Encoder(SPLADE) 모델을 위한 새로운 API가 도입되었습니다.
  • Multimodal Support: 이제 텍스트, 이미지, 오디오, 비디오 모델을 통합 API로 지원하며, 해당 학습 기능도 포함합니다.
  • Optimization Techniques: 최근에는 잘라낼 수 있는 임베딩을 위한 Matryoshka Embedding Models, 더 빠른 CPU 친화적 학습을 위한 정적 임베딩 모델, 효율적인 검색을 위한 이진 및 스칼라 임베딩 양자화가 포함됩니다.

Sources