Hugging Face Models on Foundry Managed Compute
Hugging Face Models on Foundry Managed Compute
TL;DR
Microsoft 已宣布 Foundry Managed Compute 以及 Hugging Face 模型在 Foundry 上的整合。這使企業能夠以一鍵方式將 Hugging Face 生態系統中的策展開放權重模型目錄部署到受管理的 GPU 平台即服務,並繼承 Foundry 平台上前沿模型相同的安全、治理與可觀測性。
Microsoft Foundry 與 Managed Compute
Microsoft Foundry 是一個專為建構和運行代理 AI 應用程式而設計的平台。它提供統一端點和 SDK(Python、C#、JavaScript 和 Java),以存取來自包括 Microsoft、OpenAI、Anthropic、Meta、Mistral、DeepSeek 和 Hugging Face 在內的多種提供者的廣泛模型。
Foundry Agent Service
Foundry 包含 Foundry Agent Service,提供:
- 內建記憶體的 多代理協調。
- 透過 Foundry IQ 的 知識基礎。
- 使用代理協議進行企業資料存取的 可連接工具。
- 包含端到端追蹤、即時監控、持續評估和提示優化器的 可觀測性迴路。
Enterprise Guardrails and Security
開發者可以使用整合的內容安全過濾器、任務遵守防護欄、用於對抗測試的 AI Red Teaming Agent、統一的 RBAC、私人網路以及 Azure Policy 整合。
Foundry Managed Compute
Managed Compute 是一個用於開源和自訂模型的受管理 GPU 平台即服務。它抽象了底層 GPU 拓撲,使開發者能夠根據模型參數、上下文長度和優化目標(延遲 vs. 吞吐量)進行部署。Microsoft 會自動處理支援運行時的容器更新、運行時升級和安全補丁,包括 vLLM、SGLang、TensorRT-LLM、NIM、TEI 和 llama.cpp。
Hugging Face 在 Foundry 的收藏
將 Hugging Face 模型整合到 Foundry 中,為開放權重模型提供了一個運營層,使企業能夠在保持企業安全標準的同時,利用開放 AI 的彈性。
開放模型的關鍵能力
開放權重模型允許深度客製化(微調、蒸餾、量化、LoRA)、精確的版本控制,以及透過按小時付費的加速器和閒置時縮減至零來塑造成本。
策展管線
為確保企業就緒,Hugging Face 與 Microsoft 使用系統化的五步驟策展流程:
- 識別: 根據社群訊號和客戶需求選取熱門模型。
- 合規與安全篩選: 依據 Microsoft 的企業發布政策審查授權,並檢查儲存庫以移除
trust_remote_code模式。 - 運行時建置: Microsoft 建置、掃描 CVE 並簽署推論容器映像。
- 安全權重儲存: 從 Hugging Face 拉取權重並存放在 Microsoft 管理的 Azure 儲存體中,以免在部署期間需要對 Hugging Face Hub 進行出站網路存取。
- 驗證: 在發布至目錄之前,會對每個模型、運行時和加速器組合進行 API 符合性和效能(延遲、吞吐量、TTFT)測試。
模型運行時與模態
Foundry 透過與模型架構匹配的專用運行時,支援多樣化的模態——包括文字、視覺、音訊和多模態。
- vLLM: 用於開放 LLMs 的預設高吞吐量引擎。由於 Hugging Face 對 vLLM 的貢獻,Transformers 庫的模型通常可以在 Foundry 上與它們在 Hugging Face 上發布的同一天提供服務。
- SGLang: 已針對語言和多模態模型進行優化,特別支援結構化輸出(JSON、regex),這對代理工作負載至關重要。
- Text Embeddings Inference (TEI): 用於嵌入、重新排名和序列分類模型,以優化 RAG 和語義搜尋。
- llama.cpp: 為 CPU 或小型 GPU 上的 GGUF 量化模型提供一條路徑,以實現成本最佳化的部署。
- TensorRT-LLM 和 NIM: 在 NVIDIA 硬體上使用,以獲得特定模型家族的卓越延遲和吞吐量。
- hf-serve: Hugging Face 的多模型推論伺服器,用於 LLM/嵌入快速路徑以外的架構,例如視覺和音訊。
部署與評分工作流程
從 Hugging Face 收藏部署開放權重模型涉及五個步驟:瀏覽目錄、選擇部署範本、設定實例數量、部署(透過入口網站、CLI、SDK 或 REST)以及透過統一的 Foundry 端點進行評分。
部署範本
部署範本是已版本化的資產,會固定運行時、加速器家族、上下文長度和調整設定。例如,qwen3-32b 模型可能提供不同的 NVIDIA A100 或 H100 配置及上下文長度(40K 對 128K)的範本。
整合
部署可透過使用 OpenAI SDK 的統一 Foundry 端點存取。這些模型可以作為管理員連接的模型插入 Foundry Agents,共享與前沿模型相同的驗證、端點和可觀測性。