Foundry 托管计算上的 Hugging Face 模型
Foundry 托管计算上的 Hugging Face 模型
TL;DR
微软宣布了 Foundry Managed Compute 以及 Hugging Face models on Foundry 的集成。这使企业能够以一键方式将来自 Hugging Face 生态系统的精选开放权重模型目录部署到托管的 GPU 平台即服务上,继承 Foundry 平台上前沿模型相同的安全性、治理和可观测性。
Microsoft Foundry and Managed Compute
Microsoft Foundry 是一个专门用于构建和运行代理 AI 应用程序的平台。它提供一个统一的端点和 SDK(Python、C#、JavaScript 和 Java),以访问来自包括 Microsoft、OpenAI、Anthropic、Meta、Mistral、DeepSeek 和 Hugging Face 在内的多种提供商的广泛模型。
Foundry Agent Service
Foundry 包含 Foundry Agent Service,提供:
- 多代理编排 具有内置内存。
- 知识根基 通过 Foundry IQ。
- 可连接工具 使用代理协议进行企业数据访问。
- 可观测性循环,包括端到端追踪、实时监控、持续评估和提示优化器。
Enterprise Guardrails and Security
开发者可以访问集成的内容安全过滤器、任务遵守防护栏、用于对抗性测试的 AI Red Teaming Agent、统一的 RBAC、专用网络以及 Azure Policy 集成。
Foundry Managed Compute
Managed Compute 是一个面向开源和自定义模型的托管 GPU 平台即服务。它抽象了底层 GPU 拓扑,使开发者能够根据模型参数、上下文长度和优化目标(延迟 vs. 吞吐量)进行部署。Microsoft 自动处理受支持运行时的容器更新、运行时升级和安全补丁,包括 vLLM, SGLang, TensorRT-LLM, NIM, TEI, 和 llama.cpp。
Foundry 上的 Hugging Face 集合
将 Hugging Face 模型集成到 Foundry 中为开放权重模型提供了一个操作层,使企业能够在保持企业安全标准的同时利用开放 AI 的灵活性。
开放模型的关键能力
开放权重模型允许深度自定义(fine-tuning, distillation, quantization, LoRA)、精确的版本控制,以及通过按小时付费购买加速器并在空闲时缩放到零来塑造成本。
策展管道
为了确保企业就绪,Hugging Face 和 Microsoft 使用系统化的五步策展过程:
- 识别: 根据社区信号和客户需求选择趋势模型。
- 合规与安全筛选: 许可证将根据 Microsoft 的企业分发政策进行审查,并检查存储库以移除
trust_remote_code模式。 - 运时构建: Microsoft 构建、扫描 CVE 并签名推理容器镜像。
- 安全权重存储: 权重从 Hugging Face 拉取并存储在 Microsoft 管理的 Azure 存储中,以消除部署期间对 Hugging Face Hub 的出站网络访问需求。
- 验证: 在发布到目录之前,会对每个模型、运行时和加速器的组合进行 API 符合性和性能(延迟、吞吐量、TTFT)测试。
模型运行时和模态
Foundry 支持多种模态——包括文本、视觉、音频和多模态——使用与模型架构匹配的专用运行时:
- vLLM: 开放 LLMs 的默认高吞吐量引擎。由于 Hugging Face 对 vLLM 的贡献,Transformers 库的模型通常可以在 Foundry 上与它们在 Hugging Face 上发布的同一天提供服务。
- SGLang: 针对语言和多模态模型进行了优化,特别支持结构化输出(JSON、regex) essential for agentic workloads。
- Text Embeddings Inference (TEI): 用于嵌入、重新排序和序列分类模型,以优化 RAG 和语义搜索。
- llama.cpp: 为 CPU 或小型 GPU 上的 GGUF 量化模型提供了一条路径,用于成本优化的部署。
- TensorRT-LLM 和 NIM: 在 NVIDIA 硬件上利用以获得特定模型族的卓越延迟和吞吐量。
- hf-serve: Hugging Face 的多模型推理服务器,用于 LLM/嵌入快速路径以外的架构,例如视觉和音频。
部署和评分工作流
从 Hugging Face 集合部署一个开放权重模型涉及五个步骤:浏览目录、选择部署模板、配置实例数量、部署(通过门户、CLI、SDK 或 REST)以及通过统一的 Foundry 端点进行评分。
部署模板
部署模板是固定运行时、加速器系列、上下文长度和调整设置的版本化资源。例如,qwen3-32b 模型可能提供不同的 NVIDIA A100 或 H100 配置和上下文长度(40K 对比 128K)的模板。
集成
部署可以通过使用 OpenAI SDK 的统一 Foundry 端点访问。这些模型可以作为管理员连接的模型插入 Foundry Agents,共享与前沿模型相同的身份验证、端点和可观测性。
SUMMARY: Microsoft Foundry 现在整合了一个经过策划、每周刷新的 Hugging Face 开放权重模型目录,可以通过一键部署到 Foundry 托管计算上,以实现企业级运营化。
TITLE: Foundry 托管计算上的 Hugging Face 模型