Sentence Transformers 集成至 Hugging Face Hub

Hugging Face 已将 Sentence Transformers 框架集成到 Hugging Face Hub 中,使用户能够访问、共享和测试涵盖 100 多种语言的 90 多个预训练模型。此次集成简化了为语义搜索和多语言零样本分类等应用创建具有语义意义的嵌入(embeddings)的过程。

使用新的 Hub 小部件进行交互式模型测试

为了便于模型探索,Hugging Face 推出了两个专门针对 Sentence Transformers 模型的新交互式小部件(widgets):

  • Feature Extraction Widget: 此小部件允许用户可视化模型生成的句子嵌入(即数值向量)。
  • Sentence Similarity Widget: 此小部件使用户能够直接在 Hub 界面内计算并比较不同句子之间的语义相似度。

通过 Inference API 进行程序化访问

托管在 Hub 上的 Sentence Transformers 模型可以通过 Inference API 进行访问,允许开发者在无需管理基础设施的情况下通过编程方式调用模型。用户可以发送包含源句子和候选句子列表的请求,以接收相似度评分。

精简的模型共享与发现

通过使用 model.save_to_hub("my_new_model") 方法,此次集成允许研究人员和开发者在几分钟内向社区共享训练好的 Sentence Transformers 模型。

当模型上传时,Hub 会自动生成模型卡片(model card),其中列出了架构层,并提供了如何使用 Sentence Transformerstransformers 库使用该模型的说明。为了确保可发现性,用户可以过滤 Hugging Face Hub,查找所有带有 sentence-transformers 标签的模型。

未来路线图与集成

Hugging Face 计划通过在自动创建的模型卡片中直接包含训练和评估数据,进一步增强此次集成,类似于 transformers 版本 v4.8 中发现的功能。

Hub 中现有的 Sentence Transformers 仓库可以通过使用以下标签更新其模型卡片元数据,来启用新的小部件和 Inference API:

---
tags:
  - sentence-transformers
  - sentence-similarity # Or feature-extraction!
---

此次集成是通过 huggingface_hub 库实现的,该库为支持的库提供了 API 和小部件基础设施。

Sources