GPT-4o 视觉微调 API 发布

OpenAI 为 GPT-4o 引入了视觉微调,使开发者能够使用图像和文本对模型进行定制。该功能在仅使用文本微调不足以满足需求的专门视觉任务中可实现显著提升,例如增强的视觉搜索、自动驾驶车辆的目标检测以及医学图像分析。

视觉微调的技术实现

GPT-4o 的视觉微调遵循与基于文本的微调类似的流程。开发者需要按特定格式准备图像数据集,并将其上传至 OpenAI 平台。

关键技术细节包括:

  • 数据要求:即使仅使用约 100 张图像也能实现性能提升,然而更大量的文本和图像数据可以带来更高的性能。
  • 模型支持:该功能在 gpt-4o-2024-08-06 模型快照上受支持。
  • 输入格式:数据集使用 JSON 结构,消息可以同时包含文本和 image_url 类型,类似于 OpenAI 聊天端点使用的格式。

实际性能提升

与早期合作伙伴的合作表明,视觉微调在多个领域相较于基础 GPT-4o 模型提供了显著的性能提升:

映射与基础设施(Grab)

Grab 使用 100 个示例教会 GPT-4o 定位交通标志并计数车道分隔线。结果如下:

  • 车道计数准确率提升 20%。
  • 限速标志定位提升 13%。

企业自动化(Automat)

Automat 利用截图和非结构化文档提升 RPA(机器人流程自动化)代理的表现:

  • UI 元素定位:通过使用自然语言描述训练模型定位 UI 元素,成功率从 16.60% 提升至 61.67%(提升 272%)。
  • 信息提取:在 200 张非结构化保险文档图像上进行训练,使 F1 分数提升了 7%。

数字内容创作(Coframe)

Coframe 使用图像和代码对 GPT-4o 进行微调,以生成品牌化的网站章节。该方法使模型在保持一致的视觉风格和正确布局方面相比基础模型提升了 26%。

安全、隐私与数据控制

视觉微调受 OpenAI 企业隐私承诺的约束。关键保护措施包括:

  • 数据所有权:微调后的模型仍由开发者控制,开发者保留其业务数据的完整所有权。
  • 训练限制:未经明确许可,OpenAI 不会使用视觉微调服务中的输入或输出对其基础模型进行训练。
  • 监控:OpenAI 使用自动化安全评估并监控使用情况,以确保遵守使用政策。

可用性与定价

视觉微调对所有付费使用层级的开发者开放。

定价结构(2024 年 10 月 31 日之后)

  • 训练:每 1M 令牌 25 美元。
  • 推理(输入):每 1M 令牌 3.75 美元。
  • 推理(输出):每 1M 令牌 15 美元。

图像输入会根据图像大小进行分词,并按与文本输入相同的每令牌费率计价。请注意,OpenAI 在 2024 年 10 月 31 日之前每日提供 1M 免费训练令牌。

Sources