HUGS 發布:零配置、硬體最佳化的開源大型語言模型推論服務
TL;DR
Hugging Face 宣布 HUGS (Hugging Face Generative AI Services),這是一項零配置、硬體最佳化的開源大型語言模型(LLM)推論服務,支援 NVIDIA、AMD,未來將支援 AWS Inferentia 與 Google TPU,讓企業能在內部部署模型,並提供相容 OpenAI 的 API。
零配置最佳化的開源模型推論
HUGS 消除針對特定 GPU 或 AI 加速器調校推論的工程負擔。每一次部署皆已預先測試,並自動針對目標硬體進行最佳化,提供最高吞吐量,無需手動設定。服務提供相容 OpenAI 的 API,現有應用只需更改端點 URL 即可切換至 HUGS。
為什麼選擇 HUGS?
HUGS 為需要安全且高效託管開源模型的企業而設計:
- 內部部署 – 模型在組織自有基礎設施內執行,確保資料與智慧財產不會流向公共網路。
- 零配置 – 部署時間從數週縮短至數分鐘;HUGS 會自動為 NVIDIA、AMD 或其他加速器選擇最佳模型與服務設定。
- 硬體最佳化 – 基於 Hugging Face 的 Text Generation Inference(TGI),HUGS 從每個支援的加速器中發揮峰值效能。
- 硬體彈性 – 目前支援 NVIDIA 與 AMD GPU;未來將加入 AWS Inferentia 與 Google TPU。
- 模型彈性 – 相容廣泛的開源 LLM 目錄,讓開發者自由選擇模型。
- 標準 API – 透過 Kubernetes 部署,端點模仿 OpenAI API,減少程式碼變更。
- 企業發行版 – 包含長期支援、嚴格測試、SOC2 合規以及捆綁授權,降低合規風險。
"HUGS 是部署本地即用模型的極大省時工具,效能優異——在使用 HUGS 之前,我們需要一週時間,現在不到一小時就完成。對於有主權 AI 需求的客戶而言,這是顛覆性的改變!" – Henri Jouhaud,Polyconseil 首席技術官
"我們在 GCP 上使用 L4 GPU 部署 Gemma 2,使用 HUGS 完全不需要調整函式庫、版本或參數,開箱即用。HUGS 讓我們對內部使用開源模型的可擴展性充滿信心!" – Ghislain Putois,Orange 研究工程師
工作原理
在哪裡取得 HUGS
HUGS 可透過多種發行渠道取得:
- 雲端服務供應商(CSP)市集 – 可從 AWS Marketplace 與 Google Cloud Marketplace 部署。Azure 支援即將推出。
- DigitalOcean – 以 1‑Click Models 服務形式提供於 GPU Droplets 上。
- Enterprise Hub – 企業可透過 Enterprise Hub 訂閱並提交銷售請求取得。
每個渠道皆在文件中提供平台專屬的部署說明連結。
價格
HUGS 採用依容器運行時間計費的即時付費模式:
- AWS 與 GCP 市集 – 每個容器每小時 $1,計算資源另由 CSP 計費。AWS 提供 5 天免費試用。
- DigitalOcean – 無額外 HUGS 費用,僅收取底層 GPU Droplet 的計算成本。
- Enterprise Hub – 客製化報價;有興趣者請聯絡 Hugging Face 銷售團隊。
執行推論
HUGS 以 TGI 為基礎,提供相容 OpenAI 的 Messages 端點。開發者可使用 curl、huggingface_hub SDK 或 openai Python SDK 等標準工具呼叫服務。以下示範使用 huggingface_hub:
from huggingface_hub import InferenceClient
ENDPOINT_URL = "REPLACE" # your deployed URL or IP
client = InferenceClient(base_url=ENDPOINT_URL, api_key="-")
chat_completion = client.chat.completions.create(
messages=[{"role": "user", "content": "What is Deep Learning?"}],
temperature=0.7,
top_p=0.95,
max_tokens=128,
)
支援的模型與硬體
在首次發布時,HUGS 支援 13 種熱門開源 LLM,涵蓋 Meta Llama‑3.1、NousResearch、Mistral、Google Gemma‑2 與 Qwen 系列。服務可在 NVIDIA 與 AMD GPU 上執行,未來將支援 AWS Inferentia 與 Google TPU。詳細的相容性矩陣請參閱官方 Supported Models 與 Supported Hardware 文件。
快速開始
企業可立即透過 AWS Marketplace、Google Cloud Marketplace 或 DigitalOcean 1‑Click Models 開始使用 HUGS。零配置的特性讓概念驗證開發快速上手,並順利從封閉式 API 遷移至自行託管的開源模型。
注意(2025 年 9 月更新): HUGS 的模型部署容器已不再提供。如需最佳化的 Hugging Face 模型部署,請參考 Dell Enterprise Hub 與 Azure AI Foundry 中的 Hugging Face 系列。