huggingface/setfit

Efficient few-shot learning with Sentence Transformers

何を解決するか

SetFitは、テキスト分類のために言語モデルを微調整する際に、大量のラベル付きデータや複雑で手作業によるプロンプトを必要とする問題を解決します。これにより、ユーザーは、このアプローチに通常伴う大規模なモデルを必要とすることなく、クラスあたりの非常に少ないラベル付き例(few-shot learning)で高い精度を達成できます。

仕組み

SetFitは、Sentence Transformersを微調整して豊かなテキスト埋め込みを生成する、プロンプト不要のフレームワークです。バーバリザー(verbalizers)やプロンプトに頼る代わりに、これらの埋め込みの上に分類ヘッド(scikit-learnまたは微分可能なPyTorchヘッドのいずれか)をトレーニングして、テキスト分類を実行します。

対象者

最小限のラベル付きデータと、高速なトレーニングおよび推論時間を必要とする、高性能なテキスト分類器を構築したい開発者やデータサイエンティスト。

ハイライト

  • プロンプト不要: 手作業によるプロンプトやバーバリザーの必要性を排除します。
  • 効率的: GPT-3やT0のような大規模なfew-shotモデルと比較して、トレーニングと推論の実行が大幅に高速です。
  • 多言語対応: Hugging Face Hub上のあらゆるSentence Transformerをサポートしており、複数の言語にわたる分類が可能です。
  • Hugging Faceとの統合: モデルのロード、トレーニング、およびモデルのプッシュを容易にするために、Hugging Face Hubと完全に統合されています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト