Sentence Transformers 加入 Hugging Face
Sentence Transformers 迁移至 Hugging Face
Sentence Transformers 正在从 TU Darmstadt 的 Ubiquitous Knowledge Processing (UKP) 实验室迁移到 Hugging Face。此举使该库能够受益于 Hugging Face 的基础设施,包括持续集成和测试,以确保它能够跟上信息检索和自然语言处理 (NLP) 领域的最新进展。
核心能力与采用
Sentence Transformers(亦称 SentenceBERT 或 SBERT)是一个开源库,用于生成捕捉语义含义的高质量嵌入。它被广泛用于多个关键的 NLP 任务:
- Semantic Search: 基于意义而非关键词查找文档。
- Semantic Textual Similarity: 衡量两段文本的相似程度。
- Clustering: 将相似的文本归为一组。
- Paraphrase Mining: 识别同一内容的改写版本。
截至 2025 年 10 月,Hugging Face Hub 上已有超过 16,000 个 Sentence Transformers 模型,服务超过一百万月度唯一用户。
项目治理与开源状态
Sentence Transformers 将继续作为社区驱动的开源项目,遵循 Apache 2.0 许可证。项目将继续优先考虑透明性、协作性和广泛可访问性。来自 Hugging Face 的 Tom Aarsen,自 2023 年底起维护该库,将继续领导该项目。
技术演进与历史
该库于 2019 年由 UKP 实验室的 Dr. Nils Reimers 在 Prof. Dr. Iryna Gurevych 的指导下推出,旨在克服标准 BERT 嵌入在句子级语义任务中的局限性。它采用 Siamese 网络架构,生成可通过余弦相似度高效比较的嵌入。
关键里程碑包括:
- 2020: 添加了对 400 多种语言的多语言支持。
- 2021: 扩展以支持通过 Cross Encoder 和 Sentence Transformer 模型进行成对句子评分,并与 Hugging Face Hub 集成(v2.0)。
- Late 2023: 维护权转交给 Tom Aarsen,随后引入了现代化的 Sentence Transformer 模型训练(v3.0)、Cross Encoder 的改进(v4.0)以及 Sparse Encoder 模型(v5.0)。
最近的技术进展
在 Hugging Face 的维护下,库扩展了其训练 API 和模型支持:
- Training APIs: 已为密集嵌入模型、Cross Encoder(重排序)模型和稀疏编码器(SPLADE)模型引入了新的 API。
- Multimodal Support: 库现在通过统一的 API 支持文本、图像、音频和视频模型,并提供相应的训练能力。
- Optimization Techniques: 近期的技术包括用于可截断嵌入的 Matryoshka 嵌入模型、用于更快 CPU 友好训练的静态嵌入模型,以及用于更高效检索的二进制和标量嵌入量化。