OpenAI 微调 API 改进及定制模型计划扩展
OpenAI 为其微调 API 引入了新的控制功能,并扩展了定制模型计划,涵盖了辅助微调和针对特定领域需求的全定制训练模型。
微调 API 新功能
OpenAI 为自助微调 API 引入了多项功能,为开发者提供对训练作业和模型评估的更细粒度控制。这些更新旨在通过优化模型针对特定任务的训练方式,帮助开发者降低延迟、提升准确性并降低成本。
关键技术改进包括:
- 基于 epoch 的检查点创建:API 现在在每个训练 epoch 期间自动生成一个完整的微调模型检查点。这降低了重新训练的需求,尤其是在处理过拟合时。
- 对比 Playground:全新的并排 UI 让开发者通过比较多个模型或微调快照在同一提示下的输出,进行人工评估。
- 第三方集成:已添加对第三方平台的支持,首批支持 Weights and Biases,使开发者能够将详细的微调数据集成到现有技术栈中。
- 全面验证指标:开发者现在可以在整个验证数据集上计算损失和准确率,而不是仅依赖抽样批次,从而更准确地评估模型质量。
- 超参数配置:超参数现在可以直接在仪表盘中配置,无需仅通过 API 或 SDK。
- 仪表盘改进:微调仪表盘现在支持从先前配置重新运行作业,并查看更详细的训练指标。
案例研究:Indeed
Indeed 使用 GPT-3.5 Turbo 的微调 API 来生成个性化的职位推荐。通过微调模型以产生更高质量的解释,Indeed 将提示 token 减少了 80%,从而实现了从每月不足一百万条消息扩展到约两千万条。
扩展的定制模型计划
对于需求超出自助 API 的组织,OpenAI 扩展了其定制模型计划。该计划提供与 OpenAI 研究人员的直接合作,使用先进技术针对特定领域优化模型。
辅助微调
辅助微调是一项协作服务,采用超出标准 API 的技术,包括高级超参数和大规模的多种参数高效微调(PEFT)方法。该服务面向需要帮助建立高效训练数据流水线、评估系统和定制参数的组织。
示例:SK Telecom SK Telecom 与 OpenAI 合作,对 GPT-4 进行韩语电信领域的微调。此次合作带来了:
- 对话摘要质量提升 35%。
- 意图识别准确率提升 33%。
- 客户满意度评分从 3.6 提升至 4.5(满分 5),相较于基础 GPT-4 模型。
定制训练模型
对于拥有海量专有数据集(数百万示例或数十亿 token)的组织,OpenAI 提供全定制训练模型。这些模型通过新颖的中期训练和后期训练技术修改模型训练过程,从零构建,以赋予模型深度领域知识。
示例:Harvey Harvey 是一款法律 AI 工具,与 OpenAI 合作创建了针对案例法的定制训练模型。在确定提示工程和 RAG 无法满足所需的法律历史深度后,Harvey 整合了相当于 100 亿 token 的数据。OpenAI 修改了训练过程,包括领域特定的中期训练并加入专家律师反馈。结果是:
- 事实性回复提升 83%。
- 在律师中,对定制模型输出的偏好率达到 97%,超过 GPT-4。
平台状态更新
截至 2026 年 5 月 8 日,OpenAI 正在逐步关闭微调平台。平台不再对新用户开放,但现有用户仍可在数月内继续创建训练作业。所有微调模型将在其对应的基础模型被弃用之前保持可供推理使用。