Sentence Transformers が Hugging Face に参加
Sentence Transformers が Hugging Face に移行
Sentence Transformers は、TU Darmstadt の Ubiquitous Knowledge Processing (UKP) Lab から Hugging Face へ移行しています。この移行により、ライブラリは Hugging Face のインフラストラクチャ(継続的インテグレーションやテストなど)の恩恵を受け、情報検索や自然言語処理 (NLP) の進展に常に対応できるようになります。
コア機能と採用状況
Sentence Transformers(SentenceBERT または SBERT とも呼ばれます)は、意味的な意味を捉える高品質な埋め込みを生成するためのオープンソースライブラリです。以下の主要な NLP タスクで広く利用されています:
- セマンティック検索: キーワードではなく意味に基づいて文書を検索します。
- セマンティックテキスト類似度: 2つのテキストがどれだけ類似しているかを測定します。
- クラスタリング: 類似したテキストをまとめます。
- パラフレーズマイニング: 同じ内容のパラフレーズ版を特定します。
2025年10月時点で、Hugging Face Hub には 16,000 を超える Sentence Transformers モデルがあり、月間で 100 万人以上のユニークユーザーに利用されています。
プロジェクトのガバナンスとオープンソースの状態
Sentence Transformers は、Apache 2.0 ライセンスの下でコミュニティ主導のオープンソースプロジェクトとして存続します。プロジェクトは引き続き透明性、協働、広範なアクセシビリティを重視します。2023 年後半からライブラリをメンテナンスしている Hugging Face の Tom Aarsen が、今後もプロジェクトをリードし続けます。
技術的進化と歴史
2019 年に Prof. Dr. Iryna Gurevych 配下の UKP Lab の Dr. Nils Reimers によって導入されたこのライブラリは、文レベルのセマンティックタスクにおける標準的な BERT 埋め込みの限界を克服するために作られました。コサイン類似度で効率的に比較できる埋め込みを生成するために、Siamese ネットワークアーキテクチャを採用しています。
ライブラリ開発の主なマイルストーンは次のとおりです:
- 2020: 400 以上の言語に対する多言語サポートの追加。
- 2021: Cross Encoder と Sentence Transformer モデルによるペアワイズ文スコアリングのサポート拡大と、Hugging Face Hub との統合 (v2.0)。
- 2023 年後半: メンテナンスが Tom Aarsen に移行し、Sentence Transformer モデルの最新トレーニング (v3.0)、Cross Encoder の改良 (v4.0)、Sparse Encoder モデル (v5.0) が導入されました。
最近の技術的進展
Hugging Face のメンテナンス下で、ライブラリはトレーニング API とモデルサポートを拡張しました:
- トレーニング API: 密埋め込みモデル、Cross Encoder(リランカー)モデル、Sparse Encoder(SPLADE)モデル向けの新しい API が導入されました。
- マルチモーダルサポート: ライブラリは統一 API を通じてテキスト、画像、音声、動画モデルをサポートし、対応するトレーニング機能も提供します。
- 最適化手法: 最近の開発として、切り詰め可能な埋め込みのための Matryoshka Embedding Models、CPU フレンドリーな高速トレーニングのための静的埋め込みモデル、そしてより効率的な検索のためのバイナリおよびスカラー埋め込み量子化が挙げられます.