Hugging Face 推論エンドポイント

Hugging Face は Inference Endpoints を開始しました。これは、Hugging Face Hub からクラウドインフラへ機械学習モデルのデプロイを簡素化することを目的としたマネージドサービスです。このサービスは、モデルをコンテナにパッケージ化したり、インフラをプロビジョニングしたり、予測 API を構築したりする運用負荷を取り除き、開発者がモデルページから本番環境向けエンドポイントへ数分で移行できるようにします。

マネージドデプロイワークフロー

Inference Endpoints は、Hugging Face Hub から直接モデルをデプロイできるようにします。ユーザーはモデルを選択し、好みのクラウドプロバイダー(例: AWS)とリージョン(例: eu-west-1)を選び、GPU インスタンスなどのハードウェア要件を指定できます。

Key configuration options include:

  • オートスケーリング: ユーザーは需要に応じてサービスを自動的にスケールするようオプションで設定できます。
  • カスタムコンテナ: このサービスは、特化した要件のためにカスタムコンテナを使用したデプロイをサポートします。
  • タスクサポート: 画像分類を含む幅広い機械学習タスクをサポートしています。

セキュリティとアクセス制御

Inference Endpoints は、デプロイされたモデルへのアクセスを制御するための 3 つの異なるセキュリティレベルを提供します:

  • パブリック: エンドポイントはパブリックな Hugging Face サブネットにホストされ、認証なしでインターネット上の誰でもアクセス可能です。
  • 保護された: エンドポイントはパブリックな Hugging Face サブネットにホストされますが、アクセスには有効な組織トークンが必要です。
  • プライベート: エンドポイントはプライベートな Hugging Face サブネットにホストされ、パブリックインターネットからはアクセスできません。アクセスは、AWS PrivateLink を介して作成された VPC エンドポイントを通じてユーザー自身の AWS アカウントに限定され、特定の VPC とサブネットへのアクセスを制御できます。

監視と統合

デプロイされたエンドポイントは、パフォーマンスの監視とデバッグのための統合ツールを提供します:

  • Analytics タブ: リクエストの成功率と失敗率を追跡するリアルタイムのエンドポイントメトリクスを提供します。
  • Logs タブ: サポートされていないコンテンツタイプ(例: Content-Type ヘッダーが欠如している場合)のエラーメッセージを含む、詳細な実行ログを提供します。
  • API アクセス: エンドポイントは Python または curl を使用した標準的な HTTP リクエストで呼び出すことができ、保護されたおよびプライベートな構成では認証に Bearer トークンが必要です。

本番利用ケース

Inference Endpoints は、本番グレードで HIPAA 準拠のデプロイを想定して設計されています。例えば、慢性疾患管理プラットフォームの Phamily は、サービスを利用して Transformer モデルのデプロイを加速し、厳格なコンプライアンス基準を維持しています。

Sources