Hugging Face 在 DGX 云上训练

Hugging Face 与 NVIDIA 联合推出了 Train on DGX Cloud,这项服务集成在 Hugging Face Hub 中,允许 Enterprise Hub 组织使用 NVIDIA 的加速计算基础设施对开源生成式 AI 模型进行微调。该服务通过提供无代码界面来访问高性能 GPU,解决了 GPU 稀缺和编写训练脚本的复杂性问题。

无代码模型微调

Train on DGX Cloud 让用户只需几次点击即可微调流行的开源模型。该服务由 Hugging Face AutoTrain 和 Hugging Face Spaces 提供支持,省去了手动编写、测试和调试脚本的需求。

支持的模型架构包括:

  • Llama
  • Falcon
  • Mistral
  • Mixtral
  • T5
  • Gemma
  • Stable Diffusion
  • Stable Diffusion XL

技术工作流与硬件选项

拥有 Hugging Face Enterprise 订阅的用户可以直接从支持的架构模型页面启动训练任务。该过程包括选择 Enterprise Organization 并创建 AutoTrain Space 来配置任务。

硬件配置

训练任务可以在以下 GPU 实例上执行:

  • NVIDIA H100 Tensor Core GPUs:提供 1x、2x、4x 和 8x 实例。
  • NVIDIA L40S GPUs:同样支持训练任务。

训练流程

  1. 配置:用户选择硬件、基础模型、任务以及训练参数(可通过 JSON 配置进行编辑)。
  2. 数据上传:训练数据集必须以 CSV 或 JSON 文件形式上传。
  3. 执行:AutoTrain 验证数据集并启动训练任务。
  4. 输出:完成后,微调模型会上传至用户在 Hugging Face Hub 上所选命名空间中的私有仓库。

定价模型

Train on DGX Cloud 采用按需付费模式,按 GPU 实例使用的分钟数计费。

  • NVIDIA H100 实例:每 GPU 小时 $8.25。
  • NVIDIA L40S 实例:每 GPU 小时 $2.75。

例如,使用单个 NVIDIA L40S GPU 对 1,500 条样本进行 Mistral 7B 微调,大约需要 10 分钟,费用约为 $0.45。

更广泛的 NVIDIA 与 Hugging Face 合作

Train on DGX Cloud 是 Hugging Face 与 NVIDIA 之间更大规模战略合作的一部分,旨在让加速机器学习普惠化。其他合作项目包括:

  • 开放科学:通过 BigCode 训练的代码 LLM StarCoder 2 15B,支持超过 600 种语言的训练。
  • 开源:开发了 optimum-nvidia 库,可在 NVIDIA GPU 上加速 LLM 推理,使用 Llama 2 时可实现每秒高达 1,200 个 token。
  • 推理优化:持续利用 NVIDIA TensorRT-LLM,并将流行的开源模型集成到 NVIDIA NIM 微服务中。

注意: 此服务已于 2025 年 4 月 10 日起停用并不可用。

Sources