Foundry 托管计算上的 Hugging Face 模型

Foundry 托管计算上的 Hugging Face 模型

TL;DR

微软宣布了 Foundry Managed Compute 以及 Hugging Face models on Foundry 的集成。这使企业能够以一键方式将来自 Hugging Face 生态系统的精选开放权重模型目录部署到托管的 GPU 平台即服务上,继承 Foundry 平台上前沿模型相同的安全性、治理和可观测性。

Microsoft Foundry and Managed Compute

Microsoft Foundry 是一个专门用于构建和运行代理 AI 应用程序的平台。它提供一个统一的端点和 SDK(Python、C#、JavaScript 和 Java),以访问来自包括 Microsoft、OpenAI、Anthropic、Meta、Mistral、DeepSeek 和 Hugging Face 在内的多种提供商的广泛模型。

Foundry Agent Service

Foundry 包含 Foundry Agent Service,提供:

  • 多代理编排 具有内置内存。
  • 知识根基 通过 Foundry IQ。
  • 可连接工具 使用代理协议进行企业数据访问。
  • 可观测性循环,包括端到端追踪、实时监控、持续评估和提示优化器。

Enterprise Guardrails and Security

开发者可以访问集成的内容安全过滤器、任务遵守防护栏、用于对抗性测试的 AI Red Teaming Agent、统一的 RBAC、专用网络以及 Azure Policy 集成。

Foundry Managed Compute

Managed Compute 是一个面向开源和自定义模型的托管 GPU 平台即服务。它抽象了底层 GPU 拓扑,使开发者能够根据模型参数、上下文长度和优化目标(延迟 vs. 吞吐量)进行部署。Microsoft 自动处理受支持运行时的容器更新、运行时升级和安全补丁,包括 vLLM, SGLang, TensorRT-LLM, NIM, TEI, 和 llama.cpp

Foundry 上的 Hugging Face 集合

将 Hugging Face 模型集成到 Foundry 中为开放权重模型提供了一个操作层,使企业能够在保持企业安全标准的同时利用开放 AI 的灵活性。

开放模型的关键能力

开放权重模型允许深度自定义(fine-tuning, distillation, quantization, LoRA)、精确的版本控制,以及通过按小时付费购买加速器并在空闲时缩放到零来塑造成本。

策展管道

为了确保企业就绪,Hugging Face 和 Microsoft 使用系统化的五步策展过程:

  1. 识别: 根据社区信号和客户需求选择趋势模型。
  2. 合规与安全筛选: 许可证将根据 Microsoft 的企业分发政策进行审查,并检查存储库以移除 trust_remote_code 模式。
  3. 运时构建: Microsoft 构建、扫描 CVE 并签名推理容器镜像。
  4. 安全权重存储: 权重从 Hugging Face 拉取并存储在 Microsoft 管理的 Azure 存储中,以消除部署期间对 Hugging Face Hub 的出站网络访问需求。
  5. 验证: 在发布到目录之前,会对每个模型、运行时和加速器的组合进行 API 符合性和性能(延迟、吞吐量、TTFT)测试。

模型运行时和模态

Foundry 支持多种模态——包括文本、视觉、音频和多模态——使用与模型架构匹配的专用运行时:

  • vLLM: 开放 LLMs 的默认高吞吐量引擎。由于 Hugging Face 对 vLLM 的贡献,Transformers 库的模型通常可以在 Foundry 上与它们在 Hugging Face 上发布的同一天提供服务。
  • SGLang: 针对语言和多模态模型进行了优化,特别支持结构化输出(JSON、regex) essential for agentic workloads。
  • Text Embeddings Inference (TEI): 用于嵌入、重新排序和序列分类模型,以优化 RAG 和语义搜索。
  • llama.cpp: 为 CPU 或小型 GPU 上的 GGUF 量化模型提供了一条路径,用于成本优化的部署。
  • TensorRT-LLM 和 NIM: 在 NVIDIA 硬件上利用以获得特定模型族的卓越延迟和吞吐量。
  • hf-serve: Hugging Face 的多模型推理服务器,用于 LLM/嵌入快速路径以外的架构,例如视觉和音频。

部署和评分工作流

从 Hugging Face 集合部署一个开放权重模型涉及五个步骤:浏览目录、选择部署模板、配置实例数量、部署(通过门户、CLI、SDK 或 REST)以及通过统一的 Foundry 端点进行评分。

部署模板

部署模板是固定运行时、加速器系列、上下文长度和调整设置的版本化资源。例如,qwen3-32b 模型可能提供不同的 NVIDIA A100 或 H100 配置和上下文长度(40K 对比 128K)的模板。

集成

部署可以通过使用 OpenAI SDK 的统一 Foundry 端点访问。这些模型可以作为管理员连接的模型插入 Foundry Agents,共享与前沿模型相同的身份验证、端点和可观测性。

SUMMARY: Microsoft Foundry 现在整合了一个经过策划、每周刷新的 Hugging Face 开放权重模型目录,可以通过一键部署到 Foundry 托管计算上,以实现企业级运营化。

TITLE: Foundry 托管计算上的 Hugging Face 模型

Sources