Hugging Face Hub における Sentence Transformers の統合

Hugging Face は、Sentence Transformers フレームワークを Hugging Face Hub に統合しました。これにより、ユーザーは 100 以上の言語にわたる 90 以上の学習済みモデルにアクセス、共有、およびテストすることが可能になります。この統合により、セマンティック検索や多言語ゼロショット分類などのアプリケーション向けの、意味的に意味のある埋め込みの作成が簡素化されます。

新しい Hub ウィジェットによるインタラクティブなモデルテスト

モデルの探索を容易にするため、Hugging Face は Sentence Transformers モデル専用の 2 つの新しいインタラクティブなウィジェットを導入しました。

  • Feature Extraction Widget: このウィジェットを使用すると、ユーザーはモデルによって生成された文章の埋め込み(数値ベクトル)を可視化できます。
  • Sentence Similarity Widget: このウィジェットを使用すると、ユーザーは Hub インターフェース内で直接、異なる文章間の意味的な類似性を計算および比較できます。

Inference API を介したプログラムによるアクセス

Hub にホストされている Sentence Transformers モデルは、Inference API を介してアクセス可能です。これにより、開発者はインフラストラクチャを管理することなく、プログラムによってモデルを呼び出すことができます。ユーザーは、ソース文章と候補文章のリストを含むリクエストを送信して、類似度スコアを受け取ることができます。

効率化されたモデルの共有と発見

この統合により、研究者や開発者は model.save_to_hub("my_new_model") メソッドを使用して、数分で学習済み Sentence Transformers モデルをコミュニティと共有できます。

モデルがアップロードされると、Hub はアーキテクチャのレイヤーをリストし、Sentence Transformers および transformers ライブラリの両方を使用してモデルを使用するための指示を提供するモデルカードを自動的に生成します。発見しやすくするために、ユーザーは Hugging Face Hub で sentence-transformers タグが付いたすべてのモデルをフィルタリングできます。

将来のロードマップと統合

Hugging Face は、transformers バージョン v4.8 に見られる機能と同様に、自動的に作成されるモデルカードにトレーニングおよび評価データを直接含めることで、この統合をさらに強化する予定です。

Hub 内の既存の Sentence Transformers リポジトリは、モデルカードのメタデータに以下のタグを更新することで、新しいウィジェットや Inference API を有効にできます。

---
tags:
  - sentence-transformers
  - sentence-similarity # Or feature-extraction!
---

この統合は、サポートされているライブラリ向けの API およびウィジェットのインフラストラクチャを提供する huggingface_hub ライブラリによって実現されました。

Sources