Sentence Transformers 集成於 Hugging Face Hub

Hugging Face 已將 Sentence Transformers 框架集成到 Hugging Face Hub 中,使用戶能夠訪問、共享和測試超過 100 種語言的 90 多個預訓練模型。此集成簡化了為語義搜索和多語言零樣本分類等應用程序創建語義上有意義的嵌入(embeddings)的過程。

使用新的 Hub 小部件進行交互式模型測試

為了促進模型探索,Hugging Face 引入了兩個專門針對 Sentence Transformers 模型的新交互式小部件:

  • Feature Extraction Widget: 此小部件允許用戶視覺化模型生成的句子嵌入(數值向量)。
  • Sentence Similarity Widget: 此小部件使用戶能夠直接在 Hub 界面中計算並比較不同句子之間的語義相似度。

透過 Inference API 進行程式化訪問

託管在 Hub 上的 Sentence Transformers 模型可以透過 Inference API 訪問,允許開發者在無需管理基礎設施的情況下程式化地調用模型。用戶可以發送包含源句子和候選句子列表的請求,以接收相似度分數。

精簡的模型共享和發現

此集成允許研究人員和開發者在幾分鐘內使用 model.save_to_hub("my_new_model") 方法與社區共享訓練好的 Sentence Transformers 模型。

當模型上傳時,Hub 會自動生成模型卡片(model card),其中列出了架構層,並提供了使用 Sentence Transformerstransformers 庫進行使用模型的說明。為了確保可發現性,用戶可以篩選 Hugging Face Hub 中所有標記為 sentence-transformers 的模型。

未來路線圖和集成

Hugging Face 計劃進一步增強此集成,通過在自動生成的模型卡片中直接包含訓練和評估數據,類似於 transformers 版本 v4.8 中發現的功能。

Hub 中現有的 Sentence Transformers 倉庫(repositories)可以通過使用以下標籤更新其模型卡片元數據來啟用新的小部件和 Inference API:

---
tags:
  - sentence-transformers
  - sentence-similarity # Or feature-extraction!
---

此集成是透過 huggingface_hub 庫實現的,該庫為支持的庫提供了 API 和小部件基礎設施。

Sources