Hugging Face 整合 Codex 以進行端到端機器學習實驗
Hugging Face 已將 OpenAI Codex 與 HF-skills 倉庫整合,使 AI 編碼代理能夠從資料驗證到模型部署管理完整的機器學習生命週期。此整合使工程師能將複雜的實驗(包括微調和 RL 對齊)委派給能夠自主選擇硬體、監控訓練指標並維護詳細實驗報告的代理。
自動化端到端機器學習工作流程
Codex 現在可以透過簡單的自然語言提示執行完整的機器學習實驗。通過利用 HF-skills 倉庫內的 AGENTS.md 檔案,Codex 可以執行以下任務:
- Fine-tuning and Alignment: 執行受監督微調 (SFT)、直接偏好優化 (DPO) 和帶有可驗證獎勵的強化學習 (RL)。
- 基礎設施管理:自動選擇適當的硬體(例如,
t4-small用於參數少於 1B 的模型),並將工作提交至 Hugging Face Jobs。 - 資料驗證:在 CPU 上檢查資料集,以確保與訓練方法相容(例如,驗證 SFT 的 'messages' 欄位或 DPO 的 'chosen'/'rejected' 欄位是否存在)。
- 監控與報告:透過 Trackio 檢視即時訓練指標,並維護結構化的
training_reports/<model>-<dataset>-<method>.md檔案,該檔案追蹤參數、運行狀態和評估分數。 - 部署:將模型以量化(例如 Q4_K_M)導出為 GGUF 格式以供本地部署,並將最終模型發布至 Hugging Face Hub。
技術實作與設置
此整合依賴 Model Context Protocol (MCP) 和專門的技能檔案,以連接編碼代理與 Hugging Face 生態系統之間的差距。
設定
為啟用這些功能,使用者必須安裝 Codex 並複製 HF-skills 倉庫。Codex 會自動偵測 AGENTS.md 檔案以載入必要的機器學習技能。為了更深入的 Hub 整合,使用者可以在其 ~/.codex/config.toml 檔案中設定 Hugging Face MCP 伺服器:
[mcp_servers.huggingface]
command = "npx"
args = ["-y", "mcp-remote", "https://huggingface.co/mcp?login" ]
硬體與成本擴縮
Codex 根據正在訓練的模型參數數量選擇硬體:
| 模型大小 | 推薦硬體 | 估計成本 | 使用案例 |
|---|---|---|---|
| < 1B 參數 | t4-small |
$1 - $2 | 教育/實驗 |
| 1B - 3B 參數 | t4-medium 或 a10g-small |
$5 - $15 | 小規模訓練 |
| 3B - 7B 參數 | a10g-large 或 a100-large (with LoRA) |
$15 - $40 | 生產級訓練 |
目前,該系統不支援參數超過 7B 的模型。
實驗生命週期範例
當被指派使用 open-r1/codeforces-cots 資料集和 openai_humaneval 基準來提升程式碼解決能力時,Codex 會遵循結構化的管道:
- 準備:驗證資料集並選擇最具成本效益的可用 GPU(例如,
t4-small用於 0.6B 模型)。 - 執行:將工作提交至 Hugging Face Jobs,並向使用者提供估計成本和時間(例如,~$0.30 用於 20 分鐘)。
- 追蹤:更新訓練報告,加入運行日誌和 Trackio 儀表板的連結,以進行即時損失監控。
- 評估:執行評估工作,以將微調檢查點的
pass@1分數與基礎模型進行比較。 - 最終化:如適用,合併 LoRA 適配器並將模型轉換為 GGUF 以透過
llama-server進行本地使用。
Sources
- OriginalCodex is Open Sourcing AI models