Hugging Face テキスト生成推論 (TGI) マルチバックエンドサポート
Hugging Faceは、Text Generation Inference (TGI)のためのマルチバックエンドアーキテクチャを導入し、これによりユーザーは単一の統一されたフロントエンドを使用して大規模言語モデル (LLM) をデプロイし、ハードウェアとパフォーマンスのニーズに基づいて異なる実行エンジン間を切り替えることができます。このアップデートは、TGIが複数の専門的なバックエンドを統合するレイヤーとして機能することにより、推論エコシステムの断片化に対処します。
Unified Frontend for Diverse Inference Engines
TGIは現在、さまざまな推論ソリューションと統合できるモジュラーアーキテクチャをサポートしています。このアプローチにより、ユーザーはエンジンを切り替える際に別々のバックエンドを手動で設定したり、異なるライセンスを管理したり、インフラストラクチャを再構築する必要がなくなります。一貫したユーザーエクスペリエンスを提供することにより、TGIは開発者がプライマリデプロイインターフェースを変更せずに特定のモデルやハードウェアのパフォーマンスを最適化できるようにします。
Technical Architecture: The Rust Backend Trait
TGIはRustとPythonの組み合わせで構築されています。システムは、Pythonのグローバルインタプリタロック(GIL)をバイパスすることで、HTTPおよびスケジューリングレイヤーにRustを活用し、メモリセーフティ、静的解析、高い並行性を確保しています。
マルチバックエンドサポートを有効にするため、TGIチームは新しいRust trait Backendを実装しました。このインターフェースはHTTPサーバーとスケジューラーを分離し、モデリングおよび実行エンジンの異なるものへの受信リクエストのルーティングが可能なモジュラーシステムを作成します。このtraitは、TGIエコシステムに新しい推論バックエンドを統合するための基盤となるメカニズムです。
2025 Backend Roadmap
Hugging Faceは、2025通じてさまざまな専門的なバックエンドをTGIに統合するため、いくつかのパートナーと協力しています:
- NVIDIA TensorRT-LLM: NVIDIA GPU向けの最適化されたパフォーマンスを提供するため、NVIDIAと協力し、
optimum-nvidiaと統合してTensorRT互換アーティファクトの量子化、ビルド、評価を行います。 - vLLM: vLLMをTGIバックエンドとして統合する計画は、2025年第1四半期です。
- Llama.cpp: llama.cppチームと協力し、Intel、AMD、ARMのCPUサーバー向けの堅牢なCPUベースのデプロイオプションを提供します。
- AWS Neuron: AWSと協力し、Inferentia 2およびTrainium 2のネイティブサポートを有効にします。
- Google TPU: Google JetstreamおよびTPUチームと協力し、パフォーマンスを最適化します。
これらのバックエンド機能は、Hugging Face Inference Endpointsに直接統合され、ユーザーはさまざまなハードウェアで高い信頼性とパフォーマンスを備えたモデルをすぐにデプロイできるようになります。