Hugging Face 集成 Codex 以实现端到端 ML 实验
Hugging Face 已将 OpenAI Codex 与 HF-skills 仓库集成,使 AI 编码代理能够管理从数据验证到模型部署的完整机器学习生命周期。此集成使工程师能够将复杂的实验(包括微调和 RL 对齐)委托给能够自主选择硬件、监控训练指标并保持详细实验报告的代理。
自动化端到端 ML 工作流程
Codex 现在可以通过简单的自然语言提示执行完整的机器学习实验。通过利用 HF-skills 仓库内的 AGENTS.md 文件,Codex 可以执行以下任务:
- 微调和对齐:执行带有可验证奖励的监督微调(SFT)、直接偏好优化(DPO)和强化学习(RL)。
- 基础设施管理:自动选择适当的硬件(例如,对于参数量低于 1B 的模型使用
t4-small),并将作业提交到 Hugging Face Jobs。 - 数据验证:在 CPU 上检查数据集,以确保与训练方法兼容(例如,验证 SFT 是否存在 'messages' 列,或 DPO 是否存在 'chosen'/'rejected' 列)。
- 监控和报告:通过 Trackio 查看实时训练指标,并维护一个结构化的
training_reports/<model>-<dataset>-<method>.md文件,用于跟踪参数、运行状态和评估分数。 - 部署:将模型以量化(例如 Q4_K_M)导出为 GGUF 格式以供本地部署,并将最终模型发布到 Hugging Face Hub。
技术实现与设置
此集成依赖于 Model Context Protocol(MCP)和专用技能文件,以在编码代理和 Hugging Face 生态系统之间架起桥梁。
配置
要启用这些功能,用户必须安装 Codex 并克隆 HF-skills 仓库。Codex 会自动检测 AGENTS.md 文件以加载必要的机器学习技能。为了更深入的 Hub 集成,用户可以在其 ~/.codex/config.toml 文件中配置 Hugging Face MCP 服务器:
[mcp_servers.huggingface]
command = "npx"
args = ["-y", "mcp-remote", "https://huggingface.co/mcp?login
硬件和成本扩展
Codex 根据正在训练的模型的参数数量选择硬件:
| 模型大小 | 推荐硬件 | 预估成本 | 使用场景 |
|---|---|---|---|
| < 1B parameters | t4-small |
$1 - $2 | 教育/实验 |
| 1B - 3B parameters | t4-medium 或 a10g-small |
$5 - $15 | 小规模训练 |
| 3B - 7B parameters | a10g-large 或 a100-large (with LoRA) |
$15 - $40 | 生产级训练 |
目前,该系统不支持参数量超过 7B 的模型。
实验生命周期示例
当被要求使用 open-r1/codeforces-cots 数据集和 openai_humaneval 基准来提升代码求解能力时,Codex 遵循一个结构化的流程:
- 准备:验证数据集并选择最经济可行的 GPU(例如,对于 0.6B 模型使用
t4-small)。 - 执行:将作业提交到 Hugging Face Jobs,并向用户提供估算的成本和时间(例如,~$0.30 用于 20 分钟)。
- 跟踪:通过包含运行日志和 Trackio 仪表板的链接更新训练报告,以实时监控损失。
- 评估:运行评估作业,以将微调检查点的
pass@1分数与基础模型进行比较。 - 最终化:如果适用,则合并 LoRA 适配器,并通过
llama-server将模型转换为 GGUF 格式以供本地使用。
Sources
- OriginalCodex is Open Sourcing AI models