Hugging Face 在 DGX Cloud 上的訓練

Hugging Face 與 NVIDIA 推出了 Train on DGX Cloud,這項服務整合於 Hugging Face Hub,讓 Enterprise Hub 組織能使用 NVIDIA 加速的運算基礎設施微調開源生成式 AI 模型。此服務透過提供無需編碼的介面來存取高效能 GPU,解決了 GPU 稀缺與撰寫訓練腳本的複雜性。

無代碼模型微調

Train on DGX Cloud 讓使用者只需點擊幾下即可微調流行的開源模型。此服務由 Hugging Face AutoTrain 與 Hugging Face Spaces 提供支援,省去手動編寫、測試與除錯腳本的需求。

支援的模型架構包括:

  • Llama
  • Falcon
  • Mistral
  • Mixtral
  • T5
  • Gemma
  • Stable Diffusion
  • Stable Diffusion XL

技術工作流程與硬體選項

擁有 Hugging Face Enterprise 訂閱的使用者可直接從支援架構的模型頁面啟動訓練工作。此流程包括選擇 Enterprise Organization 並建立 AutoTrain Space 以配置工作。

硬體配置

訓練工作可在以下 GPU 實例上執行:

  • NVIDIA H100 Tensor Core GPU:提供 1x、2x、4x 與 8x 實例。
  • NVIDIA L40S GPU:亦支援訓練任務。

訓練流程

  1. Configuration:使用者選擇硬體、基礎模型、任務與訓練參數(可透過 JSON 配置編輯)。
  2. Data Upload:訓練資料集必須以 CSV 或 JSON 檔案上傳。
  3. Execution:AutoTrain 會驗證資料集並啟動訓練工作。
  4. Output:完成後,微調模型會上傳至使用者在 Hugging Face Hub 上所選命名空間內的私人倉庫。

定價模式

Train on DGX Cloud 採取即付即用模式,依 GPU 實例使用分鐘數計費。

  • NVIDIA H100 實例:每 GPU 小時 $8.25。
  • NVIDIA L40S 實例:每 GPU 小時 $2.75。

例如,使用單一 NVIDIA L40S GPU 微調 Mistral 7B 於 1,500 筆樣本,大約需要 10 分鐘,成本約為 $0.45。

更廣泛的 NVIDIA 與 Hugging Face 合作

Train on DGX Cloud 是 Hugging Face 與 NVIDIA 之間更大策略夥伴關係的一部分,旨在讓加速機器學習普及化。其他合作項目包括:

  • Open Science:透過 BigCode 訓練的 StarCoder 2 15B,這是一個以超過 600 種語言訓練的程式碼 LLM。
  • Open Source:開發 optimum-nvidia 函式庫,該函式庫加速 NVIDIA GPU 上的 LLM 推論,使用 Llama 2 時可達每秒 1,200 個 token。
  • Inference Optimization:持續利用 NVIDIA TensorRT-LLM 並將流行開源模型整合至 NVIDIA NIM 微服務的工作。

Note: 此服務已於 2025 年 4 月 10 日起停用,且不再可用。

Sources