Hugging Face と FriendliAI のモデルデプロイメントにおけるパートナーシップ
Hugging Face と FriendliAI は、FriendliAI の推論インフラストラクチャを Hugging Face Hub に直接統合するためにパートナーシップを結びました。このコラボレーションにより、開発者はモデルカードの「このモデルをデプロイ」ボタンを使用して生成 AI モデルをデプロイできるようになり、モデルの発見と本番サービス間の摩擦が軽減されます。
高パフォーマンス推論インフラストラクチャ
FriendliAI は、速度とコスト効率に最適化された GPU ベースの生成 AI 推論を提供します。Artificial Analysis の調査によると、FriendliAI は最速の GPU ベースの生成 AI 推論プロバイダーとしてランク付けされています。このパフォーマンスは、いくつかのコアな技術的最適化によって駆動されています:
- Continuous Batching: リクエストの処理方法を最適化し、スループットを向上させます。
- Native Quantization: パフォーマンスへの大きな損失なく、モデルサイズとメモリ要件を削減します。
- Best-in-class Autoscaling: 需要に応じてリソースを動的に調整し、レイテンシーと運用コストを削減します。
ワンクリックデプロイメント ワークフロー
この統合により、Hugging Face Hub から FriendliAI のデプロイ環境へのシームレスな移行が可能になります。ユーザーは今では、モデルカードのデプロイオプションから Friendli Endpoints を選択でき、これが FriendliAI のモデルデプロイページにリダイレクトされます。
このインターフェースから、ユーザーは Friendli Suite アカウントを使用してオープンソースまたはカスタムの生成 AI モデルをデプロイできます。このワークフローは、手動でのインフラストラクチャ構成を必要とせず、Hub から管理された推論サービスへのモデルの移動プロセスを簡素化します。
デプロイオプション: 専用エンドポイント vs. サーバーレスエンドポイント
Friendli 専用エンドポイント
専用エンドポイントは、NVIDIA H100 GPU 上でモデルをデプロイするための管理されたサービスを提供します。このオプションは、ピークパフォーマンスとインフラストラクチャの完全な制御を必要とするユーザー向けに設計されています。FriendliAI の最適化された推論エンジンにより、開発者は高パフォーマンスを維持するために必要な GPU の総数を削減でき、それによって H100 クラスターに関連する運用コストを低減します。
Friendli サーバーレスエンドポイント
サーバーレスエンドポイントは、FriendliAI によって最適化されたオープンソースモデルの推論のための低コストで高パフォーマンスな API を提供します。これは、基礎となるハードウェアや専用インスタンスを管理することなく強力なオープンソースモデルを活用したい開発者向けの合理化されたソリューションです。
AI 開発へのインパクト
このパートナーシップにより、インフラストラクチャ管理の複雑さが解消され、開発者と研究者は GPU オーケストレーションのロジスティクスではなく、モデルのイノベーションに集中できるようになります。最適化された NVIDIA H100 インフラストラクチャとサーバーレスオプションへの直接アクセスを提供することにより、このコラボレーションは世界中の開発者にとって高パフォーマンスのオープンソース AI のアクセシビリティを向上させます。