Hugging Face の DGX Cloud トレーニング

Hugging Face と NVIDIA は、Train on DGX Cloud を開始しました。このサービスは Hugging Face Hub に統合されており、Enterprise Hub 組織が NVIDIA の高速コンピュートインフラストラクチャを利用してオープンな生成 AI モデルをファインチューニングできるようにします。このサービスは GPU の不足とトレーニングスクリプト作成の複雑さに対処し、高性能 GPU へのアクセスをノーコードインターフェースで提供します。

ノーコードモデルファインチューニング

Train on DGX Cloud により、ユーザーは数クリックで人気のオープンモデルをファインチューニングできます。このサービスは Hugging Face AutoTrain と Hugging Face Spaces によって支えられており、手動でのスクリプト作成、テスト、デバッグが不要です。

サポートされているモデルアーキテクチャは次のとおりです:

  • Llama
  • Falcon
  • Mistral
  • Mixtral
  • T5
  • Gemma
  • Stable Diffusion
  • Stable Diffusion XL

技術的ワークフローとハードウェアオプション

Hugging Face Enterprise サブスクリプションを持つユーザーは、サポートされているアーキテクチャのモデルページから直接トレーニングジョブを開始できます。プロセスは Enterprise Organization を選択し、AutoTrain Space を作成してジョブを構成することを含みます。

ハードウェア構成

トレーニングジョブは以下の GPU インスタンスで実行できます:

  • NVIDIA H100 Tensor Core GPUs:1x、2x、4x、8x のインスタンスで利用可能。
  • NVIDIA L40S GPUs:トレーニングタスクでもサポートされています。

トレーニングプロセス

  1. 構成:ユーザーはハードウェア、ベースモデル、タスク、トレーニングパラメータ(JSON 設定で編集可能)を選択します。
  2. データアップロード:トレーニングデータセットは CSV または JSON ファイルとしてアップロードする必要があります。
  3. 実行:AutoTrain がデータセットを検証し、トレーニングジョブを開始します。
  4. 出力:完了後、ファインチューニングされたモデルはユーザーが選択した名前空間内のプライベートリポジトリに Hugging Face Hub にアップロードされます。

料金モデル

Train on DGX Cloud は従量課金制で、GPU インスタンス使用時間(分単位)に基づいて請求されます。

  • NVIDIA H100 インスタンス:$8.25 / GPU 時間。
  • NVIDIA L40S インスタンス:$2.75 / GPU 時間。

例として、Mistral 7B を 1,500 サンプルで単一の NVIDIA L40S GPU を使用してファインチューニングすると、約 10 分で完了し、費用は約 $0.45 です。

NVIDIA と Hugging Face の広範な協業

Train on DGX Cloud は、加速機械学習の民主化を目指す Hugging Face と NVIDIA の戦略的パートナーシップの一環です。他の協業例は以下の通りです:

  • オープンサイエンス:600 以上の言語でトレーニングされたコード LLM、StarCoder 2 15B のトレーニング。
  • オープンソースoptimum-nvidia ライブラリの開発。これにより NVIDIA GPU 上で LLM 推論が高速化され、Llama 2 で最大 1,200 トークン/秒を実現。
  • 推論最適化:NVIDIA TensorRT-LLM の活用や、NVIDIA NIM マイクロサービスへの人気オープンモデルの統合に向けた継続的な取り組み。

注意: 本サービスは 2025 年 4 月 10日をもって廃止され、利用できなくなりました.

Sources