Hugging Face Hub에서의 Sentence Transformers 통합
Hugging Face는 Sentence Transformers 프레임워크를 Hugging Face Hub에 통합하여, 사용자가 100개 이상의 언어에 걸쳐 90개 이상의 사전 학습된 모델을 액세스, 공유 및 테스트할 수 있도록 했습니다. 이 통합은 의미론적 검색(semantic search) 및 다국어 제로샷 분류(multi-lingual zero-shot classification)와 같은 애플리케이션을 위한 의미론적으로 유의미한 임베딩을 생성하는 과정을 단순화합니다.
새로운 Hub 위젯을 통한 대화형 모델 테스트
모델 탐색을 용助하기 위해, Hugging Face는 Sentence Transformers 모델을 위해 특별히 설계된 두 가지 새로운 대화형 위젯을 도입했습니다:
- Feature Extraction Widget: 이 위젯을 통해 사용자는 모델이 생성한 문장 임베딩(수치 벡터)을 시각화할 수 있습니다.
- Sentence Similarity Widget: 이 위젯을 통해 사용자는 Hub 인터페이스 내에서 직접 서로 다른 문장 간의 의미론적 유사도를 계산하고 비교할 수 있습니다.
Inference API를 통한 프로그래밍 방식의 액세스
Hub에 호스팅된 Sentence Transformers 모델은 Inference API를 통해 액세스할 수 있어, 개발자가 인프라를 관리하지 않고도 프로그래밍 방식으로 모델을 호출할 수 있습니다. 사용자는 소스 문장과 후보 문장 목록이 포함된 요청을 보내 유사도 점수를 받을 수 있습니다.
간소화된 모델 공유 및 발견
이 통합을 통해 연구자와 개발자는 model.save_to_hub("my_new_model") 메서드를 사용하여 몇 분 만에 학습된 Sentence Transformers 모델을 커뮤니티와 공유할 수 있습니다.
모델이 업로드되면, Hub는 아키텍처 레이어를 나열하고 Sentence Transformers 및 transformers 라이브러리를 사용하여 모델을 사용하는 방법에 대한 지침을 제공하는 모델 카드를 자동으로 생성합니다. 발견 가능성을 보장하기 위해, 사용자는 Hugging Face Hub에서 sentence-transformers 태그가 지정된 모든 모델을 필터터링할 수 있습니다.
향후 로드맵 및 통합
Hugging Face는 transformers 버전 v4.8에서 볼 수 있는 기능과 유사하게, 자동으로 생성된 모델 카드에 학습 및 평가 데이터를 직접 포함함으로써 이 통합을 더욱 강화할 계획입니다.
Hub에 있는 기존 Sentence Transformers 저장소는 모델 카드 메타데이터를 다음과 같은 태그로 업데이트하여 새로운 위젯과 Inference API를 사용할 수 있습니다:
---
tags:
- sentence-transformers
- sentence-similarity # Or feature-extraction!
---
이 통합은 지원되는 라이브러리를 위한 API 및 위젯 인프라를 제공하는 huggingface_hub 라이브러리를 통해 가능해졌습니다.