Hugging Face と Cloudflare の FastRTC 統合

Hugging Face と Cloudflare は提携し、Cloudflare のグローバル WebRTC インフラストラクチャを FastRTC に統合しました。これにより、AI 開発者は独自の TURN サーバーを管理することなく、低遅延の音声および動画ストリームをデプロイできるようになります。この統合は、Hugging Face トークンを介したエンタープライズグレードの接続性を提供することで、リアルタイムマルチモーダル AI アプリケーションの重要なデプロイ障壁を取り除きます。

Cloudflare TURN サーバーによるシンプルな WebRTC デプロイ

FastRTC は WebRTC の複雑さを抽象化し、最小限の Python コードで AI 駆動の音声および動画ストリームの作成を可能にします。ただし、WebRTC アプリケーションは通常、さまざまなネットワーク環境で信頼性のある接続を確保するために、特殊な TURN(Traversal Using Relays around NAT)サーバーを必要とします。

この提携により、FastRTC 開発者は Cloudflare のグローバル TURN サーバーネットワーク(世界中に 335 カ所以上)へのアクセスが可能になります。これにより、開発者が独自の TURN インフラを構築・維持する必要がなくなり、ネットワーク管理からコアアプリケーションロジックへと焦点が移ります。

アクセスと価格モデル

開発者は有効な Hugging Face アクセストークンを使用して Cloudflare TURN ネットワークにアクセスできます。この提携には、クレジットカード不要で月間 10GB のデータストリーミングを提供する無料ティアが含まれます。より大容量が必要なアプリケーションの場合、開発者は自分の Cloudflare アカウントに移行できます。

リアルタイム AI の対象ユースケース

このインフラ統合は、信頼性が高く低遅延のストリーミングを必要とするマルチモーダル AI アプリケーションの開発を支援するために特別に設計されています。具体的には以下を含みます:

  • Voice Assistants(音声アシスタント): 自然な会話のために安定した低遅延音声ストリーミングを必要とするアプリケーション。
  • Real-Time Video Analysis(リアルタイム動画解析): ライブカメラフィードをリアルタイムで処理するアプリケーション。
  • Multimodal AI(マルチモーダル AI): 音声、動画、テキストの入力と出力をリアルタイムで組み合わせるシステム。

技術的実装と要件

Cloudflare 統合は FastRTC バージョン 0.0.20 以降で利用可能です。統合を実装するには、読み取り権限を持つ Hugging Face トークンと fastrtc[vad] パッケージが必要です。

実装例

開発者は Stream 設定内で get_cloudflare_turn_credentials 関数を使用することで、Cloudflare TURN ネットワークを使用するストリームを構成できます:

from fastrtc import ReplyOnPause, Stream, get_cloudflare_turn_credentials
import os

os.environ["HF_TOKEN"] = "<your-hf-token>"

def echo(audio):
    yield audio

stream = Stream(ReplyOnPause(echo),
                rtc_config=get_cloudflare_turn_credentials)
stream.ui.launch()

エコシステムリソース

実装の詳細については、開発者は FastRTC Cookbook または Hugging Face 上の専用 Cloudflare パートナーシップコレクションを参照できます。

Sources