Hugging Face 與 FriendliAI 合作進行模型部署

Hugging Face 與 FriendliAI 已合作,將 FriendliAI 的推理基礎設施直接整合到 Hugging Face Hub。此合作使開發者能夠使用模型卡上的「Deploy this model」按鈕部署生成式 AI 模型,減少模型發現與生產服務之間的摩擦。

高效能推理基礎設施

FriendliAI 提供以 GPU 為基礎、針對速度與成本效益最佳化的生成式 AI 推理。根據 Artificial Analysis 的評估,FriendliAI 被評為最快的 GPU 基礎生成式 AI 推理提供者。此效能源自以下幾項核心技術最佳化:

  • 持續批次處理: 優化請求處理方式以提升吞吐量。
  • 原生量化: 在不顯著降低效能的情況下減少模型大小與記憶體需求。
  • 業界領先的自動縮放: 動態調整資源以匹配需求,降低延遲與運營成本。

一鍵部署工作流程

此整合使從 Hugging Face Hub 到 FriendliAI 部署環境的過渡變得無縫。用戶現在可以在模型卡的部署選項中選取 Friendli Endpoints,這會將他們重定向到 FriendliAI 模型部署頁面。

透過此介面,用戶可以使用 Friendli Suite 帳戶部署開源或自訂的生成式 AI 模型。此工作流程簡化了從 Hub 移動模型到受管理推理服務的過程,無需手動設定基礎設施。

部署選項:專用 vs. 無伺服器端點

Friendli 專用端點

專用端點提供在 NVIDIA H100 GPU 上部署模型的受管理服務。此選項專為需要最高效能且希望完全控制基礎設施的使用者設計。FriendliAI 的最佳化推理引擎使開發者能夠減少維持高效能所需的 GPU 總數,從而降低與 H100 叢集相關的運營成本。

Friendli 無伺服器端點

無伺服器端點提供低成本、高效能的 API,用於推理已經過 FriendliAI 最佳化的開源模型。這是一種精簡的解決方案,適合希望使用強大開源模型但又不想管理任何底層硬體或專用實例的開發者。

對 AI 開發的影響

此合作移除了基礎設施管理的複雜性,使開發者和研究者能夠專注於模型創新,而非 GPU 編排的物流。透過直接存取最佳化的 NVIDIA H100 基礎設施與無伺服器選項,此合作提升了全球開發者對高效能開源 AI 的可及性。

Sources