Hugging Face 在 DGX 云上训练
Hugging Face 与 NVIDIA 联合推出了 Train on DGX Cloud,这项服务集成在 Hugging Face Hub 中,允许 Enterprise Hub 组织使用 NVIDIA 的加速计算基础设施对开源生成式 AI 模型进行微调。该服务通过提供无代码界面来访问高性能 GPU,解决了 GPU 稀缺和编写训练脚本的复杂性问题。
无代码模型微调
Train on DGX Cloud 让用户只需几次点击即可微调流行的开源模型。该服务由 Hugging Face AutoTrain 和 Hugging Face Spaces 提供支持,省去了手动编写、测试和调试脚本的需求。
支持的模型架构包括:
- Llama
- Falcon
- Mistral
- Mixtral
- T5
- Gemma
- Stable Diffusion
- Stable Diffusion XL
技术工作流与硬件选项
拥有 Hugging Face Enterprise 订阅的用户可以直接从支持的架构模型页面启动训练任务。该过程包括选择 Enterprise Organization 并创建 AutoTrain Space 来配置任务。
硬件配置
训练任务可以在以下 GPU 实例上执行:
- NVIDIA H100 Tensor Core GPUs:提供 1x、2x、4x 和 8x 实例。
- NVIDIA L40S GPUs:同样支持训练任务。
训练流程
- 配置:用户选择硬件、基础模型、任务以及训练参数(可通过 JSON 配置进行编辑)。
- 数据上传:训练数据集必须以 CSV 或 JSON 文件形式上传。
- 执行:AutoTrain 验证数据集并启动训练任务。
- 输出:完成后,微调模型会上传至用户在 Hugging Face Hub 上所选命名空间中的私有仓库。
定价模型
Train on DGX Cloud 采用按需付费模式,按 GPU 实例使用的分钟数计费。
- NVIDIA H100 实例:每 GPU 小时 $8.25。
- NVIDIA L40S 实例:每 GPU 小时 $2.75。
例如,使用单个 NVIDIA L40S GPU 对 1,500 条样本进行 Mistral 7B 微调,大约需要 10 分钟,费用约为 $0.45。
更广泛的 NVIDIA 与 Hugging Face 合作
Train on DGX Cloud 是 Hugging Face 与 NVIDIA 之间更大规模战略合作的一部分,旨在让加速机器学习普惠化。其他合作项目包括:
- 开放科学:通过 BigCode 训练的代码 LLM StarCoder 2 15B,支持超过 600 种语言的训练。
- 开源:开发了
optimum-nvidia库,可在 NVIDIA GPU 上加速 LLM 推理,使用 Llama 2 时可实现每秒高达 1,200 个 token。 - 推理优化:持续利用 NVIDIA TensorRT-LLM,并将流行的开源模型集成到 NVIDIA NIM 微服务中。
注意: 此服务已于 2025 年 4 月 10 日起停用并不可用。