Hugging Face 与 NVIDIA 推出训练集群即服务
Hugging Face 和 NVIDIA 已经推出 Training Cluster as a Service,这是一项合作计划,旨在让全球的研究机构、大学和企业能够使用大规模 GPU 集群。该服务通过让组织按需请求并为其训练运行期间的高性能 GPU 容量付费,来弥合计算资源的差距。
按需 GPU 集群可访问性
Training Cluster as a Service 为 AI 计算提供了灵活的采购模型,使 Hugging Face 上的 250,000 家组织能够根据即时需求请求特定规模的 GPU 集群。其主要目标是通过消除获取大规模计算资源的资金和后勤障碍,推动各领域基础模型的开发。
技术架构与工作流程
该服务通过以下组件将 NVIDIA 的基础设施与 Hugging Face 的开发者生态系统集成在一起:
- NVIDIA Cloud Partners: 提供最新加速计算硬件的物理容量,包括 NVIDIA Hopper 和 NVIDIA GB200,位于各地区数据中心。
- NVIDIA DGX Cloud: 作为这些地区资源的集中管理层。
- NVIDIA DGX Cloud Lepton: 在 GTC Paris 上宣布的工具,为研究人员提供已配置基础设施的访问,并管理训练任务的调度和监控。
- Hugging Face Libraries: 开源库和开发者资源用于启动和管理训练工作负载。
一旦通过 hf.co/training-cluster 提交请求,Hugging Face 与 NVIDIA 将合作根据组织的规模、地区和时长需求进行资源采购、定价和配置。
实际研究应用案例
已有多家机构使用 Training Cluster as a Service 推进专门的 AI 研究:
- TIGEM(Telethon Institute of Genomics and Medicine): 利用该服务预测致病变体的影响,并探索罕见遗传疾病的药物再定位。
- Numina: 一个非营利组织,构建用于数学推理的开源 AI,以提供 DeepMind AlphaProof 等闭源模型的开放替代方案。
- Mirror Physics: 一家初创公司,致力于在化学和材料科学领域大规模开发高保真化学模型。
更广泛的 NVIDIA 与 Hugging Face 集成
除了训练集群服务外,此次合作还在 GTC Paris 上宣布了多项其他技术集成:
- NVIDIA NIM: NVIDIA AI 客户现在可以使用 NVIDIA Inference Microservices (NIM) 部署超过 100,000 个 Hugging Face 模型。
- NVIDIA Cosmos Predict-2: 让 Hugging Face 用户能够构建自定义的 Physical AI 模型。
- NVIDIA Isaac GR00T N1.5: 现已在 Hugging Face 上可用,支持类人机器人开发。