huggingface/setfit
Efficient few-shot learning with Sentence Transformers
해결하는 문제
SetFit는 텍스트 분류를 위한 언어 모델을 미세 조정하기 위해 대량의 레이블 데이터 또는 복잡한 수작업 프롬프트가 필요하다는 문제를 해결합니다. 이는 일반적으로 이러한 접근 방식과 관련된 대규모 모델을 요구하지 않고도 클래스당 매우 적은 수의 레이블 예시(소수 샘플 학습)로 높은 정확도를 달성할 수 있도록 합니다.
작동 방식
SetFit는 Sentence Transformers를 풍부한 텍스트 임베딩을 생성하도록 미세 조정하는 프롬프트 없는 프레임워크입니다. 언어 변환기나 프롬프트에 의존하지 않고, 이러한 임베딩 위에 scikit-learn 또는 다른 미분 가능한 PyTorch 분류 헤드를 훈련시켜 텍스트 분류를 수행합니다.
대상 사용자
최소한의 레이블 데이터와 빠른 훈련 및 추론 시간으로 고성능 텍스트 분류기를 구축해야 하는 개발자 및 데이터 과학자들입니다.
주요 특징
- 프롬프트 없음: 수작업 프롬프트나 언어 변환기의 필요성을 제거합니다.
- 효율성: GPT-3 또는 T0와 같은 대규모 소수 샘플 모델보다 훈련 및 추론 속도가 훨씬 빠릅니다.
- 다국어 지원: 허깅페이스 허브에 있는 어떤 Sentence Transformer도 지원하여 여러 언어 간 분류가 가능합니다.
- 허깅페이스 통합: 허깅페이스 허브와 완전히 통합되어 모델 로딩, 훈련, 모델 푸시가 간편합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트