Hugging Face 整合 Codex 以進行端到端機器學習實驗

Hugging Face 已將 OpenAI Codex 與 HF-skills 倉庫整合,使 AI 編碼代理能夠從資料驗證到模型部署管理完整的機器學習生命週期。此整合使工程師能將複雜的實驗(包括微調和 RL 對齊)委派給能夠自主選擇硬體、監控訓練指標並維護詳細實驗報告的代理。

自動化端到端機器學習工作流程

Codex 現在可以透過簡單的自然語言提示執行完整的機器學習實驗。通過利用 HF-skills 倉庫內的 AGENTS.md 檔案,Codex 可以執行以下任務:

  • Fine-tuning and Alignment: 執行受監督微調 (SFT)、直接偏好優化 (DPO) 和帶有可驗證獎勵的強化學習 (RL)。
  • 基礎設施管理:自動選擇適當的硬體(例如,t4-small 用於參數少於 1B 的模型),並將工作提交至 Hugging Face Jobs。
  • 資料驗證:在 CPU 上檢查資料集,以確保與訓練方法相容(例如,驗證 SFT 的 'messages' 欄位或 DPO 的 'chosen'/'rejected' 欄位是否存在)。
  • 監控與報告:透過 Trackio 檢視即時訓練指標,並維護結構化的 training_reports/<model>-<dataset>-<method>.md 檔案,該檔案追蹤參數、運行狀態和評估分數。
  • 部署:將模型以量化(例如 Q4_K_M)導出為 GGUF 格式以供本地部署,並將最終模型發布至 Hugging Face Hub。

技術實作與設置

此整合依賴 Model Context Protocol (MCP) 和專門的技能檔案,以連接編碼代理與 Hugging Face 生態系統之間的差距。

設定

為啟用這些功能,使用者必須安裝 Codex 並複製 HF-skills 倉庫。Codex 會自動偵測 AGENTS.md 檔案以載入必要的機器學習技能。為了更深入的 Hub 整合,使用者可以在其 ~/.codex/config.toml 檔案中設定 Hugging Face MCP 伺服器:

[mcp_servers.huggingface]
command = "npx"
args = ["-y", "mcp-remote", "https://huggingface.co/mcp?login" ]

硬體與成本擴縮

Codex 根據正在訓練的模型參數數量選擇硬體:

模型大小 推薦硬體 估計成本 使用案例
< 1B 參數 t4-small $1 - $2 教育/實驗
1B - 3B 參數 t4-mediuma10g-small $5 - $15 小規模訓練
3B - 7B 參數 a10g-largea100-large (with LoRA) $15 - $40 生產級訓練

目前,該系統不支援參數超過 7B 的模型。

實驗生命週期範例

當被指派使用 open-r1/codeforces-cots 資料集和 openai_humaneval 基準來提升程式碼解決能力時,Codex 會遵循結構化的管道:

  1. 準備:驗證資料集並選擇最具成本效益的可用 GPU(例如,t4-small 用於 0.6B 模型)。
  2. 執行:將工作提交至 Hugging Face Jobs,並向使用者提供估計成本和時間(例如,~$0.30 用於 20 分鐘)。
  3. 追蹤:更新訓練報告,加入運行日誌和 Trackio 儀表板的連結,以進行即時損失監控。
  4. 評估:執行評估工作,以將微調檢查點的 pass@1 分數與基礎模型進行比較。
  5. 最終化:如適用,合併 LoRA 適配器並將模型轉換為 GGUF 以透過 llama-server 進行本地使用。

Sources