HUGS 发布:零配置、硬件优化的开源 LLM 推理
TL;DR
Hugging Face 宣布了 HUGS(Hugging Face Generative AI Services),这是一项零配置、硬件优化的开源 LLM 推理服务,支持 NVIDIA、AMD,未来还将支持 AWS Inferentia 和 Google TPU,使企业能够在内部部署模型,并提供兼容 OpenAI 的 API。
零配置优化的开源模型推理
HUGS 消除了针对特定 GPU 或 AI 加速器进行推理调优的工程负担。每次部署都经过预先测试,并自动针对目标硬件进行优化,提供最大吞吐量,无需手动配置。该服务提供兼容 OpenAI 的 API,现有应用只需更改端点 URL 即可切换到 HUGS。
为什么选择 HUGS?
HUGS 为需要安全高效托管开源模型的企业而设计:
- 内部部署 – 模型运行在组织自己的基础设施内,确保数据和知识产权不暴露在公共互联网。
- 零配置 – 部署时间从数周缩短到数分钟;HUGS 自动为 NVIDIA、AMD 或其他加速器选择最佳模型和服务设置。
- 硬件优化 – 基于 Hugging Face 的 Text Generation Inference(TGI),HUGS 能够从每个受支持的加速器中提取峰值性能。
- 硬件灵活性 – 目前支持 NVIDIA 和 AMD GPU;AWS Inferentia 和 Google TPU 将在后续发布。
- 模型灵活性 – 支持广泛的开源 LLM 目录,为开发者提供自由选择的空间。
- 标准 API – 通过 Kubernetes 部署,端点模拟 OpenAI API,最小化代码改动。
- 企业发行 – 包含长期支持、严格测试、SOC2 合规以及捆绑许可证,降低合规风险。
"HUGS 大幅节省了本地部署即用模型的时间并提供良好性能——在使用 HUGS 之前我们需要一周时间,现在不到 1 小时即可完成。对于有主权 AI 需求的客户来说,这是一场革命!" – Henri Jouhaud,Polyconseil 首席技术官
"我们尝试使用 HUGS 在 GCP 上的 L4 GPU 部署 Gemma 2——无需摆弄库、版本和参数,开箱即用。HUGS 让我们有信心能够扩展内部对开源模型的使用!" – Ghislain Putois,Orange 研究工程师
工作原理
如何获取 HUGS
HUGS 可通过多种分发渠道获取:
- 云服务提供商(CSP)市场 – 可从 AWS Marketplace 和 Google Cloud Marketplace 部署。Azure 支持将在近期推出。
- DigitalOcean – 作为 GPU Droplets 上的 1‑Click Models 服务提供。
- Enterprise Hub – 通过销售请求,供拥有 Enterprise Hub 订阅的组织使用。
每个渠道都提供文档中链接的特定平台部署说明。
定价
HUGS 使用基于容器运行时间的按需计费模式:
- AWS 与 GCP 市场 – 每容器每小时 $1,计算费用由 CSP 单独计费。AWS 提供 5 天免费试用。
- DigitalOcean – 不收取额外的 HUGS 费用,仅计入底层 GPU Droplet 的计算成本。
- Enterprise Hub – 定制价格;有兴趣的请联系 Hugging Face 销售。
运行推理
HUGS 基于 TGI 并提供兼容 OpenAI 的 Messages 端点。开发者可以使用标准工具如 curl、huggingface_hub SDK 或 openai Python SDK 调用该服务。以下是使用 huggingface_hub 的示例:
from huggingface_hub import InferenceClient
ENDPOINT_URL = "REPLACE" # your deployed URL or IP
client = InferenceClient(base_url=ENDPOINT_URL, api_key="-")
chat_completion = client.chat.completions.create(
messages=[{"role": "user", "content": "What is Deep Learning?"}],
temperature=0.7,
top_p=0.95,
max_tokens=128,
)
支持的模型与硬件
在发布时,HUGS 支持 13 种流行的开源 LLM,涵盖 Meta Llama‑3.1、NousResearch、Mistral、Google Gemma‑2 和 Qwen 系列。该服务运行在 NVIDIA 与 AMD GPU 上,未来将支持 AWS Inferentia 和 Google TPU。详细的兼容性矩阵请参见官方的 Supported Models 与 Supported Hardware 文档。
入门指南
企业可通过在 AWS Marketplace、Google Cloud Marketplace 或 DigitalOcean 1‑Click Models 部署,即可立即开始使用 HUGS。HUGS 的零配置特性使得快速概念验证开发以及从闭源 API 向自托管开源模型的平滑迁移成为可能。
注意(2025年9月更新): HUGS 的模型部署容器已不再提供。若需优化的 Hugging Face 模型部署,请参阅 Dell Enterprise Hub 和 Azure AI Foundry 中的 Hugging Face 集合。
SUMMARY: Hugging Face 推出 HUGS,这是一项零配置、硬件优化的开源 LLM 推理服务,支持 NVIDIA、AMD,未来还将支持 AWS Inferentia 和 Google TPU,使企业能够在内部托管模型,并提供兼容 OpenAI 的 API。
TITLE: HUGS 发布:零配置、硬件优化的开源 LLM 推理
(Note: The above includes the translated title and summary as plain text, followed by the translated Markdown body.)