Hugging Face の DGX Cloud トレーニング
Hugging Face と NVIDIA は、Train on DGX Cloud を開始しました。このサービスは Hugging Face Hub に統合されており、Enterprise Hub 組織が NVIDIA の高速コンピュートインフラストラクチャを利用してオープンな生成 AI モデルをファインチューニングできるようにします。このサービスは GPU の不足とトレーニングスクリプト作成の複雑さに対処し、高性能 GPU へのアクセスをノーコードインターフェースで提供します。
ノーコードモデルファインチューニング
Train on DGX Cloud により、ユーザーは数クリックで人気のオープンモデルをファインチューニングできます。このサービスは Hugging Face AutoTrain と Hugging Face Spaces によって支えられており、手動でのスクリプト作成、テスト、デバッグが不要です。
サポートされているモデルアーキテクチャは次のとおりです:
- Llama
- Falcon
- Mistral
- Mixtral
- T5
- Gemma
- Stable Diffusion
- Stable Diffusion XL
技術的ワークフローとハードウェアオプション
Hugging Face Enterprise サブスクリプションを持つユーザーは、サポートされているアーキテクチャのモデルページから直接トレーニングジョブを開始できます。プロセスは Enterprise Organization を選択し、AutoTrain Space を作成してジョブを構成することを含みます。
ハードウェア構成
トレーニングジョブは以下の GPU インスタンスで実行できます:
- NVIDIA H100 Tensor Core GPUs:1x、2x、4x、8x のインスタンスで利用可能。
- NVIDIA L40S GPUs:トレーニングタスクでもサポートされています。
トレーニングプロセス
- 構成:ユーザーはハードウェア、ベースモデル、タスク、トレーニングパラメータ(JSON 設定で編集可能)を選択します。
- データアップロード:トレーニングデータセットは CSV または JSON ファイルとしてアップロードする必要があります。
- 実行:AutoTrain がデータセットを検証し、トレーニングジョブを開始します。
- 出力:完了後、ファインチューニングされたモデルはユーザーが選択した名前空間内のプライベートリポジトリに Hugging Face Hub にアップロードされます。
料金モデル
Train on DGX Cloud は従量課金制で、GPU インスタンス使用時間(分単位)に基づいて請求されます。
- NVIDIA H100 インスタンス:$8.25 / GPU 時間。
- NVIDIA L40S インスタンス:$2.75 / GPU 時間。
例として、Mistral 7B を 1,500 サンプルで単一の NVIDIA L40S GPU を使用してファインチューニングすると、約 10 分で完了し、費用は約 $0.45 です。
NVIDIA と Hugging Face の広範な協業
Train on DGX Cloud は、加速機械学習の民主化を目指す Hugging Face と NVIDIA の戦略的パートナーシップの一環です。他の協業例は以下の通りです:
- オープンサイエンス:600 以上の言語でトレーニングされたコード LLM、StarCoder 2 15B のトレーニング。
- オープンソース:
optimum-nvidiaライブラリの開発。これにより NVIDIA GPU 上で LLM 推論が高速化され、Llama 2 で最大 1,200 トークン/秒を実現。 - 推論最適化:NVIDIA TensorRT-LLM の活用や、NVIDIA NIM マイクロサービスへの人気オープンモデルの統合に向けた継続的な取り組み。
注意: 本サービスは 2025 年 4 月 10日をもって廃止され、利用できなくなりました.