Hugging Face Skills: AIエージェントによるLLMファインチューニングの実現
Hugging Faceは、Hugging Face Skillsをリリースしました。これは、Claude Code、OpenAI Codex、Google Gemini CLIなどのコーディングエージェントが、大規模言語モデル(LLM)のファインチューニングのエンドツーエンドプロセスを自律的に管理できるフレームワークです。単にスクリプトを書くだけではなく、これらのエージェントは now データセットを検証し、クラウドGPUを選択し、トレーニングジョブを送信し、Trackioを介して進捗を監視し、最終的なモデルをHugging Face Hubにプッシュすることができます。
自律的ファインチューニングワークフロー
hf-llm-trainer スキルを備えたコーディングエージェントは、自然言語の指示によりフルなトレーニングライフサイクルを実行できます。たとえば、データセット上の特定のモデルをファインチューニングするリクエストは、マルチステップの自律プロセスをトリガーします:
- データセット検証: エージェントは、GPUクレジットを消費する前に、選択したトレーニング方法との互換性を確認するためにCPU上でデータセット形式を検査します。
- ハードウェア選択: エージェントは、モデルサイズを最もコスト効率の良いGPUにマッピングします(たとえば、0.6Bパラメータモデルには
t4-smallを選択)。 - ジョブ送信: エージェントはトレーニングスクリプトを生成および更新し、Hugging Face Jobsにジョブを送信し、ユーザーにジョブIDと見積もりコストを提供します。
- モニタリングとデバッグ: Trackio統合を使用して、エージェントはトレーニング損失や学習率などのリアルタイムメトリクスを報告できます。Out-of-Memory(OOM)などのエラーが発生した場合、エージェントはバッチサイズの削減またはハードウェアのアップグレードを提案します。
- デプロイ: 完了すると、モデルは自動的にHugging Face Hubにプッシュされます。
サポートされているトレーニング方法
このフレームワークは、以下の3つの主要な本番レベルのトレーニング手法をサポートしています:
教師ありファインチューニング (SFT)
SFTは、高品質なデモンストレーションデータ(入力-出力ペア)上でモデルをトレーニングするために使用されます。3Bパラメータを超えるモデルについては、エージェントは自動的に**LoRA (Low-Rank Adaptation)**を採用し、メモリ要件を削減します。これにより、7Bまたは13Bのモデルでも単一GPUでトレーニング可能になります。
ダイレクトプリファレンス最適化 (DPO)
DPOは、好みのペア(選択済み vs. 拒否済みの応答)を使用して、モデルの出力を人間の好みに合わせます。エージェントは、データセットに必要なchosenおよびrejected列(またはprompt列)が含まれていることを検証し、データセットが異なる命名規則を使用している場合はマッピングコードを提供できます。
グループ相対ポリシー最適化 (GRPO)
GRPOは、数学やコーディングの問題(例えば、openai/gsm8kデータセットでのトレーニング)など、プログラムによる成功基準を持つ検証可能なタスクに最適化された強化学習技術です。
ハードウェアマッピングとコスト効率
コストを最適化するために、エージェントはモデルサイズに基づく特定のGPUマッピングに従います:
| モデルサイズ | 推奨GPU | 推定コスト | ユースケース |
|---|---|---|---|
| 1B未満 | t4-small |
$1-2 | 教育/実験 |
| 1B - 3B | t4-medium or a10g-small |
$5-15 | 小規模チューニング |
| 3B - 7B | a10g-large or a100-large (with LoRA) |
$15-40 | 本番チューニング |
7Bパラメータを超えるモデルについては、現在のHFスキルジョブ実装は適していません。
ローカルデプロイとGGUF変換
トレーニング以外にも、エージェントはllama.cpp、Ollama、LM Studioなどのツールを介してローカル実行のためにファインチューニング済みモデルをGGUF形式に変換することができます。このプロセスには、LoRAアダプターのマージ、量子化の適用(たとえば、Q4_K_M)、および量子化されたバージョンをHubに戻すプッシュが含まれます。
セットアップと互換性
これらのスキルを使用するには、JobsにアクセスするためにPro、Team、またはEnterpriseプランのHugging Faceアカウントが必要です。これらのスキルは現在、以下と互換性があります:
- Claude Code:
/plugin marketplace add huggingface/skillsを介してインストールされます。 - OpenAI Codex:
AGENTS.mdファイルを介して識別されます。 - Gemini CLI:
gemini extensions installを介してインストールされます。
Integrations for Cursor, Windsurf, and Continue are currently in development。