Hugging Face 集成 Codex 以实现端到端 ML 实验

Hugging Face 已将 OpenAI Codex 与 HF-skills 仓库集成,使 AI 编码代理能够管理从数据验证到模型部署的完整机器学习生命周期。此集成使工程师能够将复杂的实验(包括微调和 RL 对齐)委托给能够自主选择硬件、监控训练指标并保持详细实验报告的代理。

自动化端到端 ML 工作流程

Codex 现在可以通过简单的自然语言提示执行完整的机器学习实验。通过利用 HF-skills 仓库内的 AGENTS.md 文件,Codex 可以执行以下任务:

  • 微调和对齐:执行带有可验证奖励的监督微调(SFT)、直接偏好优化(DPO)和强化学习(RL)。
  • 基础设施管理:自动选择适当的硬件(例如,对于参数量低于 1B 的模型使用 t4-small),并将作业提交到 Hugging Face Jobs。
  • 数据验证:在 CPU 上检查数据集,以确保与训练方法兼容(例如,验证 SFT 是否存在 'messages' 列,或 DPO 是否存在 'chosen'/'rejected' 列)。
  • 监控和报告:通过 Trackio 查看实时训练指标,并维护一个结构化的 training_reports/<model>-<dataset>-<method>.md 文件,用于跟踪参数、运行状态和评估分数。
  • 部署:将模型以量化(例如 Q4_K_M)导出为 GGUF 格式以供本地部署,并将最终模型发布到 Hugging Face Hub。

技术实现与设置

此集成依赖于 Model Context Protocol(MCP)和专用技能文件,以在编码代理和 Hugging Face 生态系统之间架起桥梁。

配置

要启用这些功能,用户必须安装 Codex 并克隆 HF-skills 仓库。Codex 会自动检测 AGENTS.md 文件以加载必要的机器学习技能。为了更深入的 Hub 集成,用户可以在其 ~/.codex/config.toml 文件中配置 Hugging Face MCP 服务器:

[mcp_servers.huggingface]
command = "npx"
args = ["-y", "mcp-remote", "https://huggingface.co/mcp?login

硬件和成本扩展

Codex 根据正在训练的模型的参数数量选择硬件:

模型大小 推荐硬件 预估成本 使用场景
< 1B parameters t4-small $1 - $2 教育/实验
1B - 3B parameters t4-mediuma10g-small $5 - $15 小规模训练
3B - 7B parameters a10g-largea100-large (with LoRA) $15 - $40 生产级训练

目前,该系统不支持参数量超过 7B 的模型。

实验生命周期示例

当被要求使用 open-r1/codeforces-cots 数据集和 openai_humaneval 基准来提升代码求解能力时,Codex 遵循一个结构化的流程:

  1. 准备:验证数据集并选择最经济可行的 GPU(例如,对于 0.6B 模型使用 t4-small)。
  2. 执行:将作业提交到 Hugging Face Jobs,并向用户提供估算的成本和时间(例如,~$0.30 用于 20 分钟)。
  3. 跟踪:通过包含运行日志和 Trackio 仪表板的链接更新训练报告,以实时监控损失。
  4. 评估:运行评估作业,以将微调检查点的 pass@1 分数与基础模型进行比较。
  5. 最终化:如果适用,则合并 LoRA 适配器,并通过 llama-server 将模型转换为 GGUF 格式以供本地使用。

Sources