Sentence Transformers 加入 Hugging Face

Sentence Transformers 轉移至 Hugging Face

Sentence Transformers 正從德國達姆施塔特工業大學的 Ubiquitous Knowledge Processing (UKP) Lab 轉移至 Hugging Face。此舉使該函式庫能受惠於 Hugging Face 的基礎設施,包括持續整合與測試,以確保其在資訊檢索與自然語言處理 (NLP) 的最新進展中保持同步。

核心功能與採用情況

Sentence Transformers(亦稱 SentenceBERT 或 SBERT)是一個開源函式庫,用於產生捕捉語義意義的高品質嵌入向量。它廣泛應用於多項關鍵的 NLP 任務:

  • Semantic Search: 語意搜尋:根據意義而非關鍵字尋找文件。
  • Semantic Textual Similarity: 語意文本相似度:衡量兩段文字的相似程度。
  • Clustering: 聚類:將相似的文本分組。
  • Paraphrase Mining: 同義句挖掘:辨識相同內容的不同表述。

截至 2025 年 10 月,Hugging Face Hub 上已有超過 16,000 個 Sentence Transformers 模型,服務超過每月一百萬名獨立使用者。

專案治理與開源狀態

Sentence Transformers 將持續作為社群驅動、採用 Apache 2.0 授權的開源專案。專案將繼續以透明性、協作與廣泛可及性為優先。Hugging Face 的 Tom Aarsen,自 2023 年底起維護此函式庫,將繼續領導此專案。

技術演進與歷史

該函式庫於 2019 年由 UKP Lab 的 Dr. Nils Reimers(在 Prof. Dr. Iryna Gurevych 指導下)推出,旨在克服標準 BERT 嵌入在句子層級語義任務上的限制。它採用 Siamese 網路架構,以產生可透過餘弦相似度高效比較的嵌入向量。

該函式庫發展的關鍵里程碑包括:

  • 2020: 新增對超過 400 種語言的多語言支援。
  • 2021: 擴展支援透過 Cross Encoder 與 Sentence Transformer 模型進行成對句子評分,並整合至 Hugging Face Hub(v2.0)。
  • Late 2023: 維護者轉移至 Tom Aarsen,導入現代化的 Sentence Transformer 模型訓練(v3.0)、Cross Encoder 改進(v4.0)以及 Sparse Encoder 模型(v5.0)。

最近的技術進展

在 Hugging Face 的維護下,該函式庫擴充了訓練 API 與模型支援:

  • Training APIs: 已推出針對密集嵌入模型、Cross Encoder(重新排序)模型與稀疏編碼器(SPLADE)模型的新 API。
  • Multimodal Support: 函式庫現在透過統一 API 支援文字、影像、音訊與影片模型,並提供相應的訓練功能。
  • Optimization Techniques: 近期的發展包括用於可截斷嵌入的 Matryoshka 嵌入模型、用於更快 CPU 友好訓練的靜態嵌入模型,以及用於更高效檢索的二元與標量嵌入量化。

Sources