Hugging Face Skills: 讓 AI 代理能夠微調 LLMs
Hugging Face 已發布 Hugging Face Skills,這是一個框架,使得編碼代理—例如 Claude Code、OpenAI Codex 和 Google Gemini CLI—能夠自主管理大型語言模型(LLMs)端到端的微調過程。這些代理現在不僅僅是編寫腳本,而是可以驗證資料集、選擇雲端 GPU、提交訓練作業、透過 Trackio 監控進度,並將最終模型推送到 Hugging Face Hub。
自主微調工作流程
具備 hf-llm-trainer 技能的編碼代理可以透過自然語言指令執行完整的訓練生命週期。例如,針對特定模型在資料集上進行微調的請求會觸發多步驟自主流程:
- 資料集驗證:代理會在 CPU 上檢查資料集格式,以確保在消耗 GPU 點數之前與所選訓練方法相容。
- 硬體選擇:代理會將模型大小映射到最具成本效益的 GPU(例如,對於 0.6B 參數模型選擇
t4-small)。 - 作業提交:代理會生成並更新訓練腳本,將作業提交至 Hugging Face Jobs,並向使用者提供作業 ID 與預估成本。
- 監控與除錯:透過 Trackio 整合,代理可以報告即時指標,如訓練損失和學習率。如果發生錯誤,例如記憶體不足(OOM)問題,代理會建議減少批次大小或升級硬體。
- 部署:完成後,模型會自動推送到 Hugging Face Hub。
支援的訓練方法
此框架支援三種主要的生產級訓練方法:
有監督微調 (SFT)
SFT 用於在高品質示範資料(輸入-輸出配對)上訓練模型。對於參數超過 3B 的模型,代理會自動使用 LoRA (Low-Rank Adaptation) 來降低記憶體需求,使得 7B 或 13B 模型能夠在單一 GPU 上進行訓練。
直接偏好優化 (DPO)
DPO 透過偏好配對(被選擇 vs. 被拒絕的回應)將模型輸出與人類偏好對齊。代理會驗證資料集是否包含必要的 chosen 和 rejected 欄位(或 prompt 欄位),如果資料集使用不同的命名慣例,代理可以提供對應的映射程式碼。
群體相對政策優化 (GRPO)
GRPO 是一種強化學習技術,針對具有程式化成功標準的可驗證任務進行優化,例如數學或編程問題(例如,在 openai/gsm8k 資料集上進行訓練)。
硬體映射與成本效益
為了優化成本,代理會根據模型大小遵循特定的 GPU 映射:
| 模型大小 | 推薦 GPU | 預估成本 | 使用情境 |
|---|---|---|---|
| 低於 1B | t4-small |
$1-2 | 教育/實驗 |
| 1B - 3B | t4-medium 或 a10g-small |
$5-15 | 小規模調整 |
| 3B - 7B | a10g-large 或 a100-large (with LoRA) |
$15-40 | 生產調整 |
對於參數超過 7B 的模型,目前的 HF skills 作業實作不適用。
本地部署與 GGUF 轉換
訓練之外,代理可以處理將微調模型轉換為 GGUF 格式 以便透過 llama.cpp、Ollama 或 LM Studio 等工具在本地執行。此過程包括合併 LoRA 適配器、應用量化(例如 Q4_K_M),並將量化後的版本推回 Hub。
安裝與相容性
使用這些技能需要擁有 Hugging Face 帳戶且具備 Pro、Team 或 Enterprise 方案才能存取 Jobs。這些技能目前與以下工具相容:
- Claude Code:透過
/plugin marketplace add huggingface/skills安裝。 - OpenAI Codex:透過
AGENTS.md檔案識別。 - Gemini CLI:透過
gemini extensions install安裝。
Integrations for Cursor, Windsurf, and Continue are currently in development.{