Hugging Face Skills:使能 AI 代理微调 LLMs

Hugging Face 已发布 Hugging Face Skills,一个框架,使得编码代理——如 Claude Code、OpenAI Codex 和 Google Gemini CLI——能够自主管理大型语言模型(LLMs)端到端的微调过程。这些代理不仅仅是编写脚本,现在可以验证数据集、选择云 GPU、提交训练作业、通过 Trackio 监控进度,并将最终模型推送到 Hugging Face Hub。

自主微调工作流程

配备 hf-llm-trainer 技能的编码代理可以通过自然语言指令执行完整的训练生命周期。例如,对特定模型在数据集上进行微调的请求会触发一个多步骤的自主流程:

  1. 数据集验证:代理在 CPU 上检查数据集格式,以确保在消耗 GPU 积分之前与所选训练方法兼容。
  2. 硬件选择:代理将模型大小映射到最具成本效益的 GPU(例如,为 0.6B 参数模型选择 t4-small)。
  3. 作业提交:代理生成并更新训练脚本,将作业提交到 Hugging Face Jobs,并向用户提供作业 ID 和预估成本。
  4. 监控与调试:通过 Trackio 集成,代理可以报告诸如训练损失和学习率之类的实时指标。如果发生错误,例如内存不足(OOM)问题,代理建议减小批量大小或升级硬件。
  5. 部署:完成后,模型将自动推送到 Hugging Face Hub。

支持的训练方法

该框架支持三种主要的生产级训练方法:

监督微调 (SFT)

SFT 用于在高质量演示数据(输入-输出对)上训练模型。对于参数超过 3B 的模型,代理会自动采用 LoRA (低秩自适应) 来降低内存需求,使得 7B 或 13B 模型能够在单个 GPU 上进行训练。

直接偏好优化 (DPO)

DPO 通过偏好对(被选 vs. 被拒绝的响应)将模型输出与人类偏好对齐。代理验证数据集是否包含必要的 chosenrejected 列(或 prompt 列),如果数据集使用不同的命名约定,可以提供映射代码。

群体相对策略优化 (GRPO)

GRPO 是一种强化学习技术,针对具有程序化成功标准的可验证任务进行了优化,例如数学或编码问题(如在 openai/gsm8k 数据集上进行训练)。

硬件映射和成本效率

为了优化成本,代理根据模型大小遵循特定的 GPU 映射:

模型大小 推荐 GPU 估算成本 使用场景
低于 1B t4-small $1-2 教育/实验
1B - 3B t4-mediuma10g-small $5-15 小规模调优
3B - 7B a10g-largea100-large (带 LoRA) $15-40 生产调优

对于超过 7B 参数的模型,当前 HF skills 作业实现不适用。

本地部署和 GGUF 转换

除了训练之外,代理还可以处理将微调模型转换为 GGUF 格式 以便通过 llama.cpp、Ollama 或 LM Studio 等工具在本地执行。此过程包括合并 LoRA 适配器、应用量化(例如 Q4_K_M)以及将量化版本推回 Hub。

设置和兼容性

使用这些技能需要拥有 Pro、Team 或 Enterprise 计划的 Hugging Face 账户以访问 Jobs。这些技能目前与以下内容兼容:

  • Claude Code: 通过 /plugin marketplace add huggingface/skills 安装。
  • OpenAI Codex: 通过 AGENTS.md 文件识别。
  • Gemini CLI: 通过 gemini extensions install 安装。

Integrations for Cursor, Windsurf, and Continue are currently in development.}

Sources