Hugging Face와 NVIDIA, Training Cluster as a Service 출시
Hugging Face와 NVIDIA는 Training Cluster as a Service를 출시했습니다. 이는 대규모 GPU 클러스터를 전 세계 연구 기관, 대학 및 기업이 손쉽게 이용할 수 있도록 설계된 협업 이니셔티브입니다. 이 서비스는 조직이 교육 실행 기간 동안 고성능 GPU 용량을 요청하고 비용을 지불함으로써 컴퓨팅 격차를 해소하는 것을 목표로 합니다.
온디맨드 GPU 클러스터 접근성
Training Cluster as a Service는 AI 컴퓨팅을 위한 유연한 조달 모델을 제공하여 Hugging Face에 등록된 250,000개 조직이 즉각적인 필요에 따라 특정 GPU 클러스터 규모를 요청할 수 있게 합니다. 주요 목표는 방대한 컴퓨팅 자원을 확보하는 데 따르는 재정적·물류적 장벽을 제거함으로써 다양한 분야에서 기본 모델을 개발할 수 있도록 지원하는 것입니다.
기술 아키텍처 및 워크플로우
이 서비스는 NVIDIA의 인프라와 Hugging Face 개발자 생태계를 다음 구성 요소를 통해 통합합니다:
- NVIDIA Cloud Partners: 최신 가속 컴퓨팅 하드웨어(NVIDIA Hopper 및 NVIDIA GB200 등)의 물리적 용량을 제공하며, 지역 데이터 센터에 위치합니다.
- NVIDIA DGX Cloud: 이러한 지역 리소스의 중앙 관리 레이어 역할을 합니다.
- NVIDIA DGX Cloud Lepton: GTC Paris에서 발표된 도구로, 연구자에게 프로비저닝된 인프라에 대한 접근을 제공하고 교육 실행의 스케줄링 및 모니터링을 관리합니다.
- Hugging Face Libraries: 오픈소스 라이브러리와 개발자 리소스를 사용해 교육 워크로드를 시작하고 관리합니다.
조직이 hf.co/training-cluster를 통해 요청을 제출하면, Hugging Face와 NVIDIA가 협력해 규모, 지역 및 기간에 대한 조직의 요구에 맞춰 클러스터를 소싱, 가격 책정 및 프로비저닝합니다.
실제 연구 적용 사례
여러 조직이 이미 Training Cluster as a Service를 활용해 특화된 AI 연구를 진행하고 있습니다:
- TIGEM (Telethon Institute of Genomics and Medicine): 병원성 변이의 영향을 예측하고 희귀 유전 질환에 대한 약물 재배치를 탐색하기 위해 서비스를 사용합니다.
- Numina: 비영리 단체로, 수학적 추론을 위한 오픈소스 AI를 구축하여 DeepMind의 AlphaProof와 같은 폐쇄형 모델에 대한 오픈 대안을 만들고 있습니다.
- Mirror Physics: 화학 및 재료 과학을 위한 고정밀 화학 모델을 대규모로 개발하는 스타트업입니다.
NVIDIA와 Hugging Face의 광범위한 통합
교육 클러스터 서비스 외에도, 이번 협업은 GTC Paris에서 발표된 여러 기술 통합을 포함합니다:
- NVIDIA NIM: NVIDIA AI 고객은 이제 NVIDIA Inference Microservices(NIM)를 사용해 100,000개 이상의 Hugging Face 모델을 배포할 수 있습니다.
- NVIDIA Cosmos Predict-2: Hugging Face 사용자가 맞춤형 Physical AI 모델을 구축할 수 있게 합니다.
- NVIDIA Isaac GR00T N1.5: 이제 Hugging Face에서 인간형 로봇 개발을 지원하도록 제공됩니다.