Foundry Managed Compute의 Hugging Face 모델
Foundry Managed Compute의 Hugging Face 모델
TL;DR
Microsoft는 Foundry Managed Compute와 Foundry의 Hugging Face 모델 통합을 발표했습니다. 이를 통해 기업은 Hugging Face 생태계의 엄선된 오픈 웨이트(open-weight) 모델 카탈로그를 클릭 한 번으로 관리형 GPU PaaS(Platform-as-a-Service)에 배포할 수 있으며, Foundry 플랫폼의 프론티어 모델과 동일한 보안, 거버넌스 및 관측성을 상속받을 수 있습니다.
Microsoft Foundry 및 Managed Compute
Microsoft Foundry는 에이전트형 AI 애플리케이션을 구축하고 운영하기 위해 설계된 플랫폼입니다. Microsoft, OpenAI, Anthropic, Meta, Mistral, DeepSeek, Hugging Face를 포함한 다양한 제공업체의 폭넓은 모델에 액세스할 수 있도록 통합 엔드포인트와 SDK(Python, C#, JavaScript, Java)를 제공합니다.
Foundry Agent Service
Foundry에는 다음과 같은 기능을 제공하는 Foundry Agent Service가 포함되어 있습니다:
- 내장 메모리를 갖춘 멀티 에이전트 오케스트레이션(Multi-agent orchestration).
- Foundry IQ를 통한 지식 그라운딩(Knowledge grounding).
- 기업 데이터 액세스를 위한 에이전트 프로토콜을 사용하는 연결 가능한 도구(Connectable tools).
- 엔드 투 엔드 트레이싱, 실시간 모니터링, 지속적인 평가 및 프롬프트 최적화기를 포함한 관측성 루프(Observability loops).
기업용 가드레일 및 보안
개발자는 통합된 콘텐츠 안전 필터, 작업 준수 가드레일, 적대적 테스트를 위한 AI Red Teaming Agent, 통합 RBAC, 프라이빗 네트워킹 및 Azure Policy 통합 기능을 사용할 수 있습니다.
Foundry Managed Compute
Managed Compute는 오픈 소스 및 커스텀 모델을 위한 관리형 GPU PaaS입니다. 이는 하위 GPU 토폴로지를 추상화하여 개발자가 모델 파라미터, 컨텍스트 길이 및 최적화 목표(지연 시간 vs 처리량)에 따라 배포할 수 있도록 합니다. Microsoft는 vLLM, SGLang, TensorRT-LLM, NIM, TEI, llama.cpp를 포함하여 지원되는 런타임에 대해 컨테이너 업데이트, 런타임 업그레이드 및 보안 패치를 자동으로 처리합니다.
Foundry의 Hugging Face 컬렉션
Foundry에 Hugging Face 모델을 통합하면 오픈 웨이트 모델에 대한 운영 레이어를 제공하여, 기업이 기업 보안 표준을 유지하면서 오픈 AI의 유연성을 활용할 수 있도록 합니다.
오픈 모델의 주요 기능
오픈 웨이트 모델을 사용하면 심층적인 커스터마이징(fine-tuning, distillation, quantization, LoRA), 정밀한 버전 관리, 그리고 시간당 가속기 비용 지불 및 유휴 시 제로 스케일링을 통한 비용 최적화가 가능합니다.
큐레이션 파이프라인
기업 수준의 준비성을 보장하기 위해 Hugging Face와 Microsoft는 체계적인 5단계 큐레이션 프로세스를 사용합니다:
- 식별(Identification): 커뮤니티 신호와 고객 수요를 기반으로 트렌드 모델을 선정합니다.
- 컴플라이언스 및 보안 스크리닝: Microsoft의 기업 배포 정책에 따라 라이선스를 검토하고,
trust_remote_code패턴을 제거하기 위해 저장소를 검사합니다. - 런타임 빌드: Microsoft는 추론 컨테이너 이미지를 빌드하고, CVE를 스캔하며, 서명합니다.
- 보안 웨이트 저장: 웨이트를 Hugging Face에서 가져와 Microsoft가 관리하는 Azure 스토리지에 저장하여, 배포 중 Hugging Face Hub에 대한 외부 네트워크 액세스 필요성을 제거합니다.
- 검증(Validation): 모든 모델, 런타임 및 가속기 조합은 카탈로그에 게시되기 전에 API 준수 여부와 성능(지연 시간, 처리량, TTFT)에 대해 테스트됩니다.
모델 런타임 및 모달리티
Foundry는 모델 아키텍처에 맞춘 전문 런타임을 사용하여 텍스트, 비전, 오디오 및 멀티모달을 포함한 다양한 모달리티를 지원합니다:
- vLLM: 오픈 LLM을 위한 기본 고처리량 엔진입니다. Hugging Face의 vLLM 기여 덕분에 Transformers 라이브러리 모델은 종종 Hugging Face에 올라온 당일에 Foundry에서 서비스될 수 있습니다.
- SGLang: 언어 및 멀티모달 모델에 최적화되어 있으며, 특히 에이전트 워크로드에 필수적인 구조화된 출력(JSON, regex)을 지원합니다.
- Text Embeddings Inference (TEI): RAG 및 시맨틱 검색을 최적화하기 위해 임베딩, 리랭커 및 시퀀스 분류 모델에 사용됩니다.
- llama.cpp: 비용 최적화된 배포를 위해 CPU 또는 소형 GPU에서 GGUF 양자화 모델을 사용할 수 있는 경로를 제공합니다.
- TensorRT-LLM 및 NIM: 특정 모델 제품군에 대해 우수한 지연 시간과 처리량을 제공하기 위해 NVIDIA 하드웨어에서 활용됩니다.
- hf-serve: 비전 및 오디오와 같이 LLM/임베딩 패스트 패스 이외의 아키텍처를 위한 Hugging Face의 멀티 모델 추론 서버입니다.
배포 및 스코어링 워크플로우
Hugging Face 컬렉션에서 오픈 웨이트 모델을 배포하는 과정은 카탈로그 탐색, 배포 템플릿 선택, 인스턴스 수 구성, 배포(포털, CLI, SDK 또는 REST를 통해), 통합 Foundry 엔드포인트를 통한 스코어링의 5단계로 이루어집니다.
배포 템플릿
배포 템플릿은 런타임, 가속기 제품군, 컨텍스트 길이 및 튜닝 설정을 고정하는 버전 관리된 자산입니다. 예를 들어, qwen3-32b 모델은 서로 다른 NVIDIA A100 또는 H100 구성 및 컨텍스트 길이(40K vs 128K)에 대한 템플릿을 제공할 수 있습니다.
통합
배포된 모델은 OpenAI SDK를 사용하여 통합 Foundry 엔드포인트를 통해 접근할 수 있습니다. 이러한 모델은 관리자 연결 모델로서 Foundry Agents에 배치될 수 있으며, 프론티어 모델과 동일한 인증, 엔드포인트 및 관측성을 공유합니다.