Hugging Face Skills: 讓 AI 代理能夠微調 LLMs

Hugging Face 已發布 Hugging Face Skills,這是一個框架,使得編碼代理—例如 Claude Code、OpenAI Codex 和 Google Gemini CLI—能夠自主管理大型語言模型(LLMs)端到端的微調過程。這些代理現在不僅僅是編寫腳本,而是可以驗證資料集、選擇雲端 GPU、提交訓練作業、透過 Trackio 監控進度,並將最終模型推送到 Hugging Face Hub。

自主微調工作流程

具備 hf-llm-trainer 技能的編碼代理可以透過自然語言指令執行完整的訓練生命週期。例如,針對特定模型在資料集上進行微調的請求會觸發多步驟自主流程:

  1. 資料集驗證:代理會在 CPU 上檢查資料集格式,以確保在消耗 GPU 點數之前與所選訓練方法相容。
  2. 硬體選擇:代理會將模型大小映射到最具成本效益的 GPU(例如,對於 0.6B 參數模型選擇 t4-small)。
  3. 作業提交:代理會生成並更新訓練腳本,將作業提交至 Hugging Face Jobs,並向使用者提供作業 ID 與預估成本。
  4. 監控與除錯:透過 Trackio 整合,代理可以報告即時指標,如訓練損失和學習率。如果發生錯誤,例如記憶體不足(OOM)問題,代理會建議減少批次大小或升級硬體。
  5. 部署:完成後,模型會自動推送到 Hugging Face Hub。

支援的訓練方法

此框架支援三種主要的生產級訓練方法:

有監督微調 (SFT)

SFT 用於在高品質示範資料(輸入-輸出配對)上訓練模型。對於參數超過 3B 的模型,代理會自動使用 LoRA (Low-Rank Adaptation) 來降低記憶體需求,使得 7B 或 13B 模型能夠在單一 GPU 上進行訓練。

直接偏好優化 (DPO)

DPO 透過偏好配對(被選擇 vs. 被拒絕的回應)將模型輸出與人類偏好對齊。代理會驗證資料集是否包含必要的 chosenrejected 欄位(或 prompt 欄位),如果資料集使用不同的命名慣例,代理可以提供對應的映射程式碼。

群體相對政策優化 (GRPO)

GRPO 是一種強化學習技術,針對具有程式化成功標準的可驗證任務進行優化,例如數學或編程問題(例如,在 openai/gsm8k 資料集上進行訓練)。

硬體映射與成本效益

為了優化成本,代理會根據模型大小遵循特定的 GPU 映射:

模型大小 推薦 GPU 預估成本 使用情境
低於 1B t4-small $1-2 教育/實驗
1B - 3B t4-mediuma10g-small $5-15 小規模調整
3B - 7B a10g-largea100-large (with LoRA) $15-40 生產調整

對於參數超過 7B 的模型,目前的 HF skills 作業實作不適用。

本地部署與 GGUF 轉換

訓練之外,代理可以處理將微調模型轉換為 GGUF 格式 以便透過 llama.cpp、Ollama 或 LM Studio 等工具在本地執行。此過程包括合併 LoRA 適配器、應用量化(例如 Q4_K_M),並將量化後的版本推回 Hub。

安裝與相容性

使用這些技能需要擁有 Hugging Face 帳戶且具備 Pro、Team 或 Enterprise 方案才能存取 Jobs。這些技能目前與以下工具相容:

  • Claude Code:透過 /plugin marketplace add huggingface/skills 安裝。
  • OpenAI Codex:透過 AGENTS.md 檔案識別。
  • Gemini CLI:透過 gemini extensions install 安裝。

Integrations for Cursor, Windsurf, and Continue are currently in development.{

Sources